{"as_of":"2026-08-08T21:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:71210a3c387579fb26349cf59b73ee1cb10bce59e107548b9316e6d892400c6d","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T12:49:09.834338Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:21:53.430055Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T23:21:53.849642Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"cited_work":{"arxiv_id":"2607.19343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.19343","snapshot_observed_at":"2026-08-07T23:21:53.849642Z","title":"Masked Visual Actions for Unified World Modeling","venue":"cs.CV","work_id":"58f15a56-10bf-464f-9ed7-d0f3c8b4623b","year":2026},"citing_paper":{"arxiv_id":"2608.05799","last_updated":"2026-08-06T09:35:33Z","snapshot_observed_at":"2026-08-08T20:16:41.004353Z","submitted_at":"2026-08-06T09:35:33Z","title":"XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T23:21:53.430055Z"},"links":{"cited_paper":"/paper/2607.19343","citing_paper":"/paper/2608.05799"},"observation_digest":"sha256:eb077d9a9e70e9dc477cadcdb022c9a0dbfd84ee6210c3b29212a6330b73c1f7","observation_id":"106f1d63-784b-4ced-a55e-ba457d3205a3","resolution":{"observed_at":"2026-08-07T23:21:53.853473Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.19343/citation-record","integrity":"/paper/2607.19343/integrity","json":"/paper/2607.19343/citation-record.json","paper":"/paper/2607.19343"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:48:57.894759Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T12:48:57.894759Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:584c267d938929f85e3ee5c7da2b7317804fbea4c1f14103a9823ea46d6accd9","observation_id":"e144fd38-614d-4d79-abd4-e49972c8b038","resolution":{"observed_at":"2026-08-01T12:48:57.894759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01828","last_updated":"2023-06-02T17:45:44Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T17:45:44Z","title":"Unifying (Machine) Vision via Counterfactual World Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01828","snapshot_observed_at":"2026-08-01T12:48:58.164826Z","title":"Unifying (machine) vision via counterfactual world modeling.arXiv preprint arXiv:2306.01828, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T12:48:58.164826Z"},"links":{"cited_paper":"/paper/2306.01828","citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:45661192733043cb7adfc931fb14edc7930894db82fbe226d80f7124a33a0e3e","observation_id":"e153cc02-ae9a-4090-93c7-4e9c44efb71b","resolution":{"observed_at":"2026-08-01T12:48:58.164826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:48:58.324753Z","title":"Track2act: Predicting point tracks from internet videos enables generalizable robot manipulation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T12:48:58.324753Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:89fd923e3291961c10f93b7f06b352f7032a47b71767995b2f30be905de5e8cf","observation_id":"d43bb27a-7e9e-4a6c-8454-03d2bb8fd1d9","resolution":{"observed_at":"2026-08-01T12:48:58.324753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:48:58.544990Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T12:48:58.544990Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:8a94f084ea2bd8885a030b6c138fd098c8d5467492b52855990fe44a6c07d020","observation_id":"c396244a-b33e-42f5-bf6f-64d27e5ee62d","resolution":{"observed_at":"2026-08-01T12:48:58.544990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:48:58.718932Z","title":"Go-with-the-flow: Motion-controllable video diffusion models using real-time warped noise","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T12:48:58.718932Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:70899ea02bd209356c74e14cd6c27aa9163285338aeecd207efbd97ea8720c55","observation_id":"92e1cc1d-2170-4645-a044-ddedd9816a4f","resolution":{"observed_at":"2026-08-01T12:48:58.718932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:48:58.894834Z","title":"SAM 3: Segment anything with concepts","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T12:48:58.894834Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:8117172fa7fef586be2fa776adf4614809e349a00573cd87e602b14a02f5d847","observation_id":"a06037db-a4bd-4f57-ba84-c9faefb0c543","resolution":{"observed_at":"2026-08-01T12:48:58.894834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:48:59.064864Z","title":"Freeman, Jitendra Malik, Russ Tedrake, Vincent Sitzmann, and Yilun Du","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T12:48:59.064864Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:6f4d7e6d231602b544e32edbec75381c5d2d6924ec21c02d58be176577f81a5d","observation_id":"7fe0aad0-dfcd-4a31-b296-27d8a4bf916c","resolution":{"observed_at":"2026-08-01T12:48:59.064864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:48:59.254754Z","title":"Learning coordinated bimanual manipulation policies using state diffusion and inverse dynamics models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T12:48:59.254754Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:36fa52f8a6bab2dddc4d1ad5dea8e8c392250bbaf3e40409eeb8fbeb525ff66d","observation_id":"26bcfb5d-e03a-4987-8e76-c0ed0e00c3e9","resolution":{"observed_at":"2026-08-01T12:48:59.254754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:48:59.497836Z","title":"Tool-as-interface: Learning robot policies from observing human tool use","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T12:48:59.497836Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:8e0c823c82c463702b75a99f975d105f82a563c096d4d6a3c9c3df902c65200c","observation_id":"43dbe581-b2c1-463d-9d58-6c9a81cf636a","resolution":{"observed_at":"2026-08-01T12:48:59.497836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:48:59.894801Z","title":"Bridgev2w: Bridging video generation models to embodied world models via embodiment masks.arXiv preprint arXiv:2602.03793, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T12:48:59.894801Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:09bd59e0580d7e3ca63152d7c039e7260abc787ae102c62953e3d2961aff9a7d","observation_id":"bf9c6eef-c02e-458a-9ffa-3599ee0fdc41","resolution":{"observed_at":"2026-08-01T12:48:59.894801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:00.023922Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:00.023922Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:8065aee98a771cbf1d4a808b9a94f793fc23b0297ae7c61842289a7ef642c1c8","observation_id":"1702a4b4-9cc9-495d-96b9-1e3d7d5bd874","resolution":{"observed_at":"2026-08-01T12:49:00.023922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:00.102142Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:00.102142Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:8a6dd0498a9eb47c9b1c8acfe48c01aed8b6edc4a86c1f74278912de49cac195","observation_id":"ffcbb56b-0b93-4263-b34a-091724c31d4d","resolution":{"observed_at":"2026-08-01T12:49:00.102142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:00.184836Z","title":"Wan-move: Motion-controllable video generation via latent trajectory guidance.arXiv preprint arXiv:2512.08765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:00.184836Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:0ef2bd443f5705c66fffd096260b3a2c8465caed841771303905b18dfd8020ae","observation_id":"918e5046-42ee-4c96-8962-40cdc95f6386","resolution":{"observed_at":"2026-08-01T12:49:00.184836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:00.324749Z","title":"Embodis- wap for zero-shot robot imitation learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:00.324749Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:e8da2606e8013629387d9b43c78d4292490dadb29780df76566e6f668a2dcdf9","observation_id":"5561a96c-a2c6-4294-87fa-ef81884764bc","resolution":{"observed_at":"2026-08-01T12:49:00.324749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:00.475099Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:00.475099Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:4408634a30e565aa3742876c961a107620eab5e563c0cd23d5c8b05db66678c9","observation_id":"5747730c-af1d-45c0-8fff-4325a4508157","resolution":{"observed_at":"2026-08-01T12:49:00.475099Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:00.624831Z","title":"Learning universal policies via text-guided video generation.Advances in neural information processing systems, 36:9156–9172, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:00.624831Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:8fc342833243824527b212e36afd6baee8c76c7849eb8b1650a556fa90dc650a","observation_id":"8a7ed1bd-fb04-45ef-9469-912c526c3b19","resolution":{"observed_at":"2026-08-01T12:49:00.624831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:00.749493Z","title":"Video language planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:00.749493Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:be06fc41e451f4a0d72e58555e8bb1723cf4b7c725a75fbc1ab62bfad2a07443","observation_id":"49ffcd05-92a8-48b5-9401-c21ca9b33844","resolution":{"observed_at":"2026-08-01T12:49:00.749493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:00.868780Z","title":"Aim: Intent-aware unified world action modeling with spatial value maps, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:00.868780Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:6b79b8d84a3f25cc47844b963f13d19618c94e378a9a0c15435a1d7c085aa343","observation_id":"f3f80707-501b-4a75-81ad-66c7d1ae9ecc","resolution":{"observed_at":"2026-08-01T12:49:00.868780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06949","snapshot_observed_at":"2026-08-01T12:49:01.042267Z","title":"Zentner, George Kurian, Suneel Indupuru, Pooya Jannaty, Jinwei Gu, Jun Zhang, Jitendra Malik, Pieter Abbeel, Ming-Yu Liu, Yuke Zhu, Joel Jang, and Linxi \"Jim\" Fan","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:01.042267Z"},"links":{"cited_paper":"/paper/2602.06949","citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:56644fb29383b446a6bfd9165a1cb555d4b94b17b406b934d6146a195a0290af","observation_id":"218a1261-205c-49d1-b6d7-4c2ac1f53fab","resolution":{"observed_at":"2026-08-01T12:49:01.042267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:01.159661Z","title":"Motion prompting: Controlling video generation with motion trajectories","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:01.159661Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:8f6d664286dac2ecd444d7b9a10a909ecd5f2c4a0b4ef26d766cebcec9cef57d","observation_id":"9c26af47-6a88-4cbd-a16c-2d2cdd90d647","resolution":{"observed_at":"2026-08-01T12:49:01.159661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:01.443907Z","title":"Force prompting: Video generation models can learn and generalize physics-based control signals","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:01.443907Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:e9d18c0c3c81752276fc18a52399b5740f330dcac9d2b51c177d6830c922f079","observation_id":"36716550-3d81-459c-b6ac-995455b6fc26","resolution":{"observed_at":"2026-08-01T12:49:01.443907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:01.584937Z","title":"Goal force: Teaching video models to accomplish physics-conditioned goals","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:01.584937Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:bc6782f0e669859053ab88d843f5ae21c22faa3efaf96314505373282b93de52","observation_id":"f7e4cc6c-b7b1-4171-a1c9-16586381e5f6","resolution":{"observed_at":"2026-08-01T12:49:01.584937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:01.704765Z","title":"World models for learning dexterous hand-object interactions from human videos.arXiv preprint arXiv:2512.13644, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:01.704765Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:5a3af3f42b98f418ea61be2d3dfa824578092243eb19f4b276fedd241cdc2826","observation_id":"9cfc4af1-0d8f-4a72-934d-6001de896cfb","resolution":{"observed_at":"2026-08-01T12:49:01.704765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:01.844740Z","title":"Unified 4d world action modeling from video priors with asynchronous denoising, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:01.844740Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:60a653dffc4511f4aa5af439895643abe1cff61691931def6fd5b0c8d7435b2b","observation_id":"c74a524d-0ea2-4d14-b1f0-f7a703a5db5b","resolution":{"observed_at":"2026-08-01T12:49:01.844740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:02.035375Z","title":"Ctrl-world: A controllable generative world model for robot manipulation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:02.035375Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:fe80ef7e2161eebe7a6eb24425c4656b88b7aa5116221551820c36f1ed0e6f07","observation_id":"befed282-d539-46a9-8cfe-ff39cbb91804","resolution":{"observed_at":"2026-08-01T12:49:02.035375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:02.110836Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:02.110836Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:04caaedbb1d4c5620175102de04a154135a6bb340ba643c908bface8ce459209","observation_id":"d01eb595-33ff-422c-98e1-b41d4659e08c","resolution":{"observed_at":"2026-08-01T12:49:02.110836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:02.216476Z","title":"Vid2world: Crafting video diffusion models to interactive world models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:02.216476Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:42df5918e73f639ac2526a066688c890c3c063ecc32b13c7c1e1436840c69a20","observation_id":"7a64bf78-7d54-4a87-920f-a83b8a4d6bb0","resolution":{"observed_at":"2026-08-01T12:49:02.216476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:02.362222Z","title":"Pointworld: Scaling 3d world models for in-the-wild robotic manipulation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:02.362222Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:3896413b1f041c6c750003eac9bee421dd76df12bd04aed5dacff6357db91fa4","observation_id":"26522a78-c911-4297-b9e6-0d427f2dde09","resolution":{"observed_at":"2026-08-01T12:49:02.362222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:02.461021Z","title":"Dreamgen: Unlocking generalization in robot learning through video world models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:02.461021Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:9b2516574e895b1261ad26024964d60cf5ceea389bcd53182f6e485d67fdfa1c","observation_id":"b4d59e25-62ab-47a1-82c2-9c5f5436eb9c","resolution":{"observed_at":"2026-08-01T12:49:02.461021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:02.585802Z","title":"Cotracker3: Simpler and better point tracking by pseudo-labelling real videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:02.585802Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:1607c2f32c1526bbad5d54e7c813080b3e13158dbe53cc90f618f27197ee46df","observation_id":"3929f513-5414-4dd7-a112-24134706778f","resolution":{"observed_at":"2026-08-01T12:49:02.585802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:02.742391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:02.742391Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:8fec6ee42142c95f649a45f70e4bd133fc5c02546b93166aad319c38446ec8fa","observation_id":"9b1a1e0b-06b9-41dc-81a7-b2570c4306ce","resolution":{"observed_at":"2026-08-01T12:49:02.742391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:02.843637Z","title":"Dexterous world models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:02.843637Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:7fc0284c136b07d34db845e5818782767ec2c67dcd7668c39e6f756ed42878ec","observation_id":"2f03d7b5-a577-4f6b-a1df-fc7892c172f2","resolution":{"observed_at":"2026-08-01T12:49:02.843637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:02.952171Z","title":"Cosmos policy: Fine-tuning video models for visuomotor control and planning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:02.952171Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:e0b14955dfc887fce7e5f1244eef019373001627ef0396c5da1f66497d2d48b8","observation_id":"25ed980f-2583-4209-a8ce-bfa49fa23bc8","resolution":{"observed_at":"2026-08-01T12:49:02.952171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08576","last_updated":"2023-10-12T17:59:23Z","snapshot_observed_at":"2026-08-05T14:38:36.869054Z","submitted_at":"2023-10-12T17:59:23Z","title":"Learning to Act from Actionless Videos through Dense Correspondences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08576","snapshot_observed_at":"2026-08-01T12:49:03.044032Z","title":"Learning to act from actionless videos through dense correspondences.arXiv preprint arXiv:2310.08576, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:03.044032Z"},"links":{"cited_paper":"/paper/2310.08576","citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:a3ed1270ad08bba317dfbe9559d04eb9704988f44a90f127ae8d9b0d56b005bb","observation_id":"d97b8c95-b61e-4c8d-854f-b13625b305e5","resolution":{"observed_at":"2026-08-01T12:49:03.044032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09737","last_updated":"2025-09-10T18:01:04Z","snapshot_observed_at":"2026-08-08T13:38:01.687801Z","submitted_at":"2025-09-10T18:01:04Z","title":"World Modeling with Probabilistic Structure Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09737","snapshot_observed_at":"2026-08-01T12:49:03.136308Z","title":"World modeling with probabilistic structure integration.arXiv preprint arXiv:2509.09737, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:03.136308Z"},"links":{"cited_paper":"/paper/2509.09737","citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:96c70f1c2faaabf4c1b1ba6fe6b6182ec2d6e20ea487ab7f3b9cc81f3b1d7d3e","observation_id":"9fe16f9f-8f3c-4a56-86a0-ac38483916fd","resolution":{"observed_at":"2026-08-01T12:49:03.136308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:03.214635Z","title":"Shadow: Leveraging segmentation masks for cross-embodiment policy transfer, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:03.214635Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:c19165ca0a9c310acef344acfd2186ff6ed653cb59b850d87fa11fe046a37d8b","observation_id":"52ae5854-5dda-4b1d-8ecd-77042020424b","resolution":{"observed_at":"2026-08-01T12:49:03.214635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:03.274841Z","title":"Masquerade: Learning from in-the-wild human videos using data-editing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:03.274841Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:f1687e46c99c927e061fdf07cb1aba2a906b80f4ea329763bdccf6656157196a","observation_id":"a9afdf0e-3d47-4ea8-ac4a-73c7f631f9d4","resolution":{"observed_at":"2026-08-01T12:49:03.274841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:03.364897Z","title":"Phantom: Training robots without robots using only human videos, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:03.364897Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:66560feac685723fca3c4b8624e4347fd8f67e8eebc9fb50923dd73a894c9ae9","observation_id":"a8ce6fbf-8a79-44b1-839b-0219aec38154","resolution":{"observed_at":"2026-08-01T12:49:03.364897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09227","last_updated":"2024-03-14T09:48:36Z","snapshot_observed_at":"2026-08-06T09:37:53.788323Z","submitted_at":"2024-03-14T09:48:36Z","title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09227","snapshot_observed_at":"2026-08-01T12:49:03.472167Z","title":"Karen Liu, Jiajun Wu, and Li Fei-Fei","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:03.472167Z"},"links":{"cited_paper":"/paper/2403.09227","citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:fba188e49dba025ae40dbbb81dafc107cc3dff56ef7f3c16c4145850fbb347ee","observation_id":"14ccab1a-39b2-44ea-961e-92fbae02a8c0","resolution":{"observed_at":"2026-08-01T12:49:03.472167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:03.614750Z","title":"Mask2iv: Interaction-centric video generation via mask trajectories, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:03.614750Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:7b6bbba6d3fcc248ce59848957491583804e0baa236fccbd391cba6a7ecfd09c","observation_id":"64a8cd3a-318b-48f5-a5bd-864f78f11963","resolution":{"observed_at":"2026-08-01T12:49:03.614750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:03.715409Z","title":"Novaflow: Zero-shot manipulation via actionable flow from generated videos, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:03.715409Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:13e198519a25ec23f560875cd95756861b24ef32100ef826af20d8041cc5c5e8","observation_id":"00decb5e-3f9b-4070-bd75-a0d881ff15b5","resolution":{"observed_at":"2026-08-01T12:49:03.715409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:03.844866Z","title":"Unified video action model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:03.844866Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:c8a184a90a430566448052bbad400854d4f0a845a94ec5ce9c999f4aafe66311","observation_id":"2cd019cd-cb77-4e3b-8b63-0d3b591854f2","resolution":{"observed_at":"2026-08-01T12:49:03.844866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:03.969261Z","title":"Genie envisioner: A unified world foundation platform for robotic manipulation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:03.969261Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:39fd83e7203e9596219d346e802e145add066d4ad615b17ef345f4584c5c60d3","observation_id":"e3a97ca1-f025-4352-8f6b-92a27f8b75c0","resolution":{"observed_at":"2026-08-01T12:49:03.969261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:04.146958Z","title":"Realwonder: Real-time physical action-conditioned video generation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:04.146958Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:98734c4605a5a218901a0248900a17f3c87d0ed7b4d12c91ff620350c9b9fcf7","observation_id":"7074bee0-8bfb-406c-bb61-2d156196acaf","resolution":{"observed_at":"2026-08-01T12:49:04.146958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:04.313578Z","title":"Zero-shot world models are developmentally efficient learners.arXiv e-prints, pages arXiv–2604, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:04.313578Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:ae92d18ec94ccb8c0a4c93ff9279f2d1611f0e00e74071dcf94adcc6148de343","observation_id":"aeda653a-28e4-49e1-8fb2-551c6dd612fb","resolution":{"observed_at":"2026-08-01T12:49:04.313578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-01T12:49:04.440100Z","title":"Fixing weight decay regularization in adam.arXiv preprint arXiv:1711.05101, 5(5):5, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:04.440100Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:a98a3a1335ff52f12d693d198cf49137d873f7b95f5a6c834015e900eba944a2","observation_id":"0a3626b9-18bd-4032-8342-7b75e430cd94","resolution":{"observed_at":"2026-08-01T12:49:04.440100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:04.517419Z","title":"Mask world model: Predicting what matters for robust robot policy learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:04.517419Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:07231640187055297b13320ecfb9ec2684269edf722943433c5a362cecf0da0a","observation_id":"53ca9292-a352-415c-867c-1d1d2f99feca","resolution":{"observed_at":"2026-08-01T12:49:04.517419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:04.669230Z","title":"Inference-time scaling for diffusion models beyond scaling denoising steps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:04.669230Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:e037ea19b192f99c9fa5199895a76adabf4e16455feac2e3916fd23f5c0b02aa","observation_id":"8d819bb7-73ec-48cb-a4fb-3a1113f2eabc","resolution":{"observed_at":"2026-08-01T12:49:04.669230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17596","last_updated":"2023-10-26T17:17:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-26T17:17:31Z","title":"MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17596","snapshot_observed_at":"2026-08-01T12:49:04.803449Z","title":"Mimicgen: A data generation system for scalable robot learning using human demonstrations.arXiv preprint arXiv:2310.17596, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:04.803449Z"},"links":{"cited_paper":"/paper/2310.17596","citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:6220631a04630cbd8541645116d769e5b16d8afaae256132752c1ba4102b280a","observation_id":"1797b1cc-201e-402b-903f-e5c8efb61ce4","resolution":{"observed_at":"2026-08-01T12:49:04.803449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:04.967163Z","title":"Motubrain: An advanced world action model for robot control, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:04.967163Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:66dacd316a8e00b7b3f67efee5a5e0b68e86a9c3fd1cdfd56a76ca49a7e03546","observation_id":"ba782044-7c09-43b3-ac79-7443413b524d","resolution":{"observed_at":"2026-08-01T12:49:04.967163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:05.141732Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:05.141732Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:9eaed4e11299abe7a88c041057160b1f296cde1f6718f045f1954ea8f614e07c","observation_id":"9418a5d4-53e5-41d5-a965-49c5dfd9f8fc","resolution":{"observed_at":"2026-08-01T12:49:05.141732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:05.213696Z","title":"Robocasa365: A large-scale simulation framework for training and benchmarking generalist robots","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:05.213696Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:8a0ebdcd2ead4eca1e76c12260f079926de7eb45024129a67e4a667cbdf917b7","observation_id":"b115d4ba-4cf2-4981-a1d7-77bdd298e8ce","resolution":{"observed_at":"2026-08-01T12:49:05.213696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:05.313907Z","title":"Cosmos world foundation model platform for physical ai, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:05.313907Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:a446ffdd9c9e13a7e67a0aacadc0a4be33b04b0f00679abcd0ba9b10c3316fb9","observation_id":"66f9331b-073c-4c7f-b8e1-b45d435d366e","resolution":{"observed_at":"2026-08-01T12:49:05.313907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:05.491244Z","title":"mimic-video: Video-action models for generalizable robot control beyond vlas, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:05.491244Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:b8b7d1b3a6c8663fa6f81b2ad88db2d18b2377ae774afd904e7e0d16470e89ed","observation_id":"21d004a3-c5b7-49c1-8d44-8eee52cd6107","resolution":{"observed_at":"2026-08-01T12:49:05.491244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:05.647880Z","title":"Inference-time enhancement of generative robot policies via predictive world modeling.IEEE Robotics and Automation Letters, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:05.647880Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:8434095c359f60a9e4c07c288a617ce2442263a8c4bfe241bd1b50f3a99e10c4","observation_id":"dd72077b-bc3b-4629-93d2-a02b9ada1f64","resolution":{"observed_at":"2026-08-01T12:49:05.647880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:05.770198Z","title":"MotionStream: Real-Time Video Generation with Interactive Motion Controls","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:05.770198Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:4bf13e0c35a358d17e9a5d38398faedf9a2ea965fddad599fdc7e6ff891b66de","observation_id":"71b4d916-03dc-4871-b8a2-c00044d164e1","resolution":{"observed_at":"2026-08-01T12:49:05.770198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-01T12:49:05.914908Z","title":"Smolvla: A vision-language-action model for affordable and efficient robotics.arXiv preprint arXiv:2506.01844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:05.914908Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:afb877965e9e8a89f92b2b5f0a3002399031efc6a47486d473058add6f860dbc","observation_id":"1ec0c14c-6f66-4171-a489-5ad8b747535b","resolution":{"observed_at":"2026-08-01T12:49:05.914908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:06.115706Z","title":"Time-to-move: Training-free motion-controlled video generation via dual-clock denoising","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:06.115706Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:54a8b2a298ce395173bee87b898485e8592530f8635cd04cb904c8be4c419d46","observation_id":"11d1fc99-ed4d-4540-8640-45f8b08d9725","resolution":{"observed_at":"2026-08-01T12:49:06.115706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:06.248811Z","title":"Motion before action: Diffusing object motion as manipulation condition, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:06.248811Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:dce4fd14c14a36053ef3eeb1c56412dff155dc93d5b876e2803d3ed9014e1b4b","observation_id":"7af91829-ba8c-458f-a05f-24b492076649","resolution":{"observed_at":"2026-08-01T12:49:06.248811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:06.418490Z","title":"Evaluating gemini robotics policies in a veo world simulator, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:06.418490Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:d3dbfc7fa1a6cf89d448d9668b6f57f15a00058e0749da911d80e3b9fdb375dd","observation_id":"5fcd5563-ee5d-4d2f-8558-01d98ef167a4","resolution":{"observed_at":"2026-08-01T12:49:06.418490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:06.557565Z","title":"Causal video models are data-efficient robot policy learners.Rhoda AI Blog, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:06.557565Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:c93e63a2d7a4b9d50dffde574d8863aca86cdaa142c22f7ea1ef39819364e7fa","observation_id":"3bd46ac0-233f-4c9d-b740-f7251e10d84d","resolution":{"observed_at":"2026-08-01T12:49:06.557565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:06.659959Z","title":"Understanding physical dynamics with counterfactual world modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:06.659959Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:c052fd18727b2cdd2bde3a98b90f06b55de6f34d2ba82dd8d6356426b2f4a121","observation_id":"eec87124-0133-4b11-8def-0642d0540e5a","resolution":{"observed_at":"2026-08-01T12:49:06.659959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T12:49:06.746750Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:06.746750Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:c37e13184c9900b7e02eef6fe0cd4dc5df535f9eac2ef7b95a824fda07958990","observation_id":"62940561-bdaf-4541-b98a-a626f1390d4b","resolution":{"observed_at":"2026-08-01T12:49:06.746750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:06.915628Z","title":"Eva: Aligning video world models with executable robot actions via inverse dynamics rewards, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:06.915628Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:e6b406750a6ede63738d4b3e57f4a80a19d38674a50492592add41172d426b30","observation_id":"9b9c6d2d-e9a9-4417-8cb2-57c7a9b151d2","resolution":{"observed_at":"2026-08-01T12:49:06.915628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:06.965342Z","title":"Interactive world simulator for robot policy training and evaluation.arXiv preprint arXiv:2603.08546, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:06.965342Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:732a595da0b2ba2810bed5abb9957fddfbf42c2186fb047c7c5b91e695d5ca7e","observation_id":"c3dcb25d-8b7a-455e-bf13-25ecb7dc3cbe","resolution":{"observed_at":"2026-08-01T12:49:06.965342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:07.047797Z","title":"Precise action-to-video generation through visual action prompts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:07.047797Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:cbd93a0e91be60ad334f05d7caf5c995c25deb7f34076d6be42454786dad9572","observation_id":"741604b0-4a2d-4094-a57e-0a50123789e9","resolution":{"observed_at":"2026-08-01T12:49:07.047797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0960-9822(01)00432-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wolpert and J","venue":"Current Biology","work_id":"f79d18e4-68df-41ed-b11f-6f17ef09bb7d","year":2001},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:07.189078Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:a647524699fc102991c4a157b7547717c0c693c539e66560245df8bf7d6ccb9d","observation_id":"f7cdd53a-fa44-48ef-960c-1a816e2d4875","resolution":{"observed_at":"2026-08-01T12:53:42.293862Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:07.307228Z","title":"Wolpert, Zoubin Ghahramani, and Michael I","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:07.307228Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:ebaaa6fccfe707d2c85bf19a344abc6891f44d76d70c78f0bab15bcfc961eb93","observation_id":"85aa13da-c5b9-4d46-801a-221179b3d2c5","resolution":{"observed_at":"2026-08-01T12:49:07.307228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:07.401627Z","title":"Wolpert, R","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:07.401627Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:5721dcee38313ec0a993c4b025a104a9eccf5cb0f2bceeb3f6d76f186b6e7bd8","observation_id":"cf8c8a53-9b1c-4fbf-9340-eae84e13fda8","resolution":{"observed_at":"2026-08-01T12:49:07.401627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:07.439272Z","title":"Sun, Ashley Neall, Tong Wu, Shengqu Cai, and Gordon Wetzstein","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:07.439272Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:b622aa6a2883a64a62dd1859ba0822d2bc79de634bee98ddc9f54b24f00a29d7","observation_id":"99715a3f-d73f-40a5-a1ab-86533f20e61c","resolution":{"observed_at":"2026-08-01T12:49:07.439272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:07.518129Z","title":"Kinema4d: Kinematic4d world modeling for spatiotemporal embodied simulation.arXiv preprint arXiv:2603.16669, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:07.518129Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:5369185707f319c9970a307458b7bb9fab4b7801c138e23d483c6927802b489a","observation_id":"f5d9321b-9944-43d7-abc5-f5748404f8fb","resolution":{"observed_at":"2026-08-01T12:49:07.518129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:07.719051Z","title":"RoboPanoptes: The All-Seeing Robot with Whole-body Dexterity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:07.719051Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:b9f97ead077b371723db105181872010639ef997684b5af445d38c078aa7ea5a","observation_id":"8cfdc1d7-e718-41b2-9505-ac8e1d8a3d17","resolution":{"observed_at":"2026-08-01T12:49:07.719051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-01T12:49:07.854932Z","title":"Learning interactive real-world simulators.arXiv preprint arXiv:2310.06114, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:07.854932Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:61e20f8fd41f13b80f2148077d4e159bef5d6cb54c10ef93491a67cc3ed263f3","observation_id":"ab6ab918-592d-4345-85df-311e9e6c4ab7","resolution":{"observed_at":"2026-08-01T12:49:07.854932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:07.975262Z","title":"Orv: 4d occupancy-centric robot video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:07.975262Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:f458e4bbcfe57fcf05ed24986e19d9b4efb575ff0ac5397fcd95c97f03985974","observation_id":"84c4a1d6-799e-470f-8c8a-c27e4f9caa3e","resolution":{"observed_at":"2026-08-01T12:49:07.975262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:08.072132Z","title":"Real-to-sim robot policy evaluation with gaussian splatting simulation of soft-body interactions","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:08.072132Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:999ef8015ffb471352f0513370e2a23081578352fe3ff5ecd254adfed6d8bf37","observation_id":"a8e5f30f-c093-4a77-8085-dcaeba235004","resolution":{"observed_at":"2026-08-01T12:49:08.072132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:08.184918Z","title":"Veo-act: How far can frontier video models advance generalizable robot manipulation?, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:08.184918Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:40cd1706438bd09f4a7ddfec64632aeef4437473f01d5d69ab7b814727aaabd2","observation_id":"84f6297c-83a5-4b2f-ac76-2c38fd5fab04","resolution":{"observed_at":"2026-08-01T12:49:08.184918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-01T12:49:08.273965Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware.arXiv preprint arXiv:2304.13705, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:08.273965Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:fa00f7cb48a44a51e8140dce96cfd2b00f44c0a1c576401d5b40b8c8c030fa20","observation_id":"7fccbe33-c8ae-4be6-a725-5274c7345b24","resolution":{"observed_at":"2026-08-01T12:49:08.273965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20995","last_updated":"2025-04-29T17:59:30Z","snapshot_observed_at":"2026-08-07T15:58:07.214768Z","submitted_at":"2025-04-29T17:59:30Z","title":"TesserAct: Learning 4D Embodied World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20995","snapshot_observed_at":"2026-08-01T12:49:08.342623Z","title":"Tesseract: learning 4d embodied world models.arXiv preprint arXiv:2504.20995, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:08.342623Z"},"links":{"cited_paper":"/paper/2504.20995","citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:6042edda5e94b14e7b9b7cf147d6150a176518487e9d0d9bac5ee8b05b0cd3f1","observation_id":"6c349569-4e4e-44f4-a7b6-6acc18cc9ca9","resolution":{"observed_at":"2026-08-01T12:49:08.342623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:08.422235Z","title":"Action images: End-to-end policy learning via multiview video generation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:08.422235Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:338764bfba34e03d4bf978fb50e3a98142864bd39eaf53a467af84b15ef00deb","observation_id":"8d9b496d-c710-48b7-8b9d-8339d9ea3ca8","resolution":{"observed_at":"2026-08-01T12:49:08.422235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:08.526653Z","title":"3dflowaction: Learning cross-embodiment manipulation from 3d flow world model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:08.526653Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:847c875acf23c138d56627dd88ff3154e800fc51531f53cfa16fc90291454fa7","observation_id":"d5264796-98d5-4805-88bd-ef0430366b8d","resolution":{"observed_at":"2026-08-01T12:49:08.526653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:08.630493Z","title":"Unified world models: Coupling video and action diffusion for pretraining on large robotic datasets, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:08.630493Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:351cb087570b53854bf2f056a957ff666f260aa4f37c468baf8543b86cb5d6c8","observation_id":"02ec8abe-6c1a-4de1-8892-851c0f196470","resolution":{"observed_at":"2026-08-01T12:49:08.630493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:08.710108Z","title":"Irasim: Learning interactive real-robot action simulators","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:08.710108Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:0d1d8da2277a31e5a2f9303ea9ed4de46b9ab07de6f6a5c1cb9f83f074c6c50f","observation_id":"89f044fc-98f3-4c8f-ace7-cb3e24366785","resolution":{"observed_at":"2026-08-01T12:49:08.710108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:08.889648Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:08.889648Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:3244588efeaed811a4c048663179b29a5004a831ab026e16fd1a0af78f232d27","observation_id":"5ab4aa41-44c7-4018-a44f-70630b5e1320","resolution":{"observed_at":"2026-08-01T12:49:08.889648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:09.033921Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:09.033921Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:1e951fce95772b58e51c6c4e380bc3bf383a0315de87bdedf4f710e676a77972","observation_id":"bf97c2d8-397f-4f77-9d92-8dc248a27450","resolution":{"observed_at":"2026-08-01T12:49:09.033921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:09.150745Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:09.150745Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:37e8982a1d551b56b60f881f5acc0ca5e4046578512bf6079f24fb2ab1734703","observation_id":"9b682be1-bf24-422b-a688-e78410cff85f","resolution":{"observed_at":"2026-08-01T12:49:09.150745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:09.279685Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:09.279685Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:a932cd6eb6a1a8924bba3bc290c062f3310a5776771d74ce8fd615a36bffe045","observation_id":"fe024360-1b51-40aa-a64c-a06c41f6aca3","resolution":{"observed_at":"2026-08-01T12:49:09.279685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:09.427171Z","title":"Covers Diffusion Policy, ACT, and SmolVLA baselines","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:09.427171Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:3e885b4735d0b81dc300b2b1d752ca9d1452b59957f43379d67340260da57723","observation_id":"95f7312e-19d5-42d6-94c0-7ad8072974d4","resolution":{"observed_at":"2026-08-01T12:49:09.427171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:09.512352Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:09.512352Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:7ec23b55a7534425c81f4ed3cdef9e6a965b0d584557dffd5add922cda32d0b7","observation_id":"21b2c77b-ec9e-4e58-ab39-bdd522ca28a7","resolution":{"observed_at":"2026-08-01T12:49:09.512352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:09.557487Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:09.557487Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:7176ea2c886f39bfc8739745341698e3028dce8daa613a902515175b09454e99","observation_id":"40ca33fc-e5b8-44ee-b02f-2fe35df2e30d","resolution":{"observed_at":"2026-08-01T12:49:09.557487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:09.642077Z","title":"the toaster door must be flush, latched, and closed by a push from below","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:09.642077Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:0b27a9fab3e58784e288526459fa0f67a46a601d0cd6dab31ca483a7c6bead3b","observation_id":"2d75b15b-efbb-4d84-bf59-8a6507ff0f7c","resolution":{"observed_at":"2026-08-01T12:49:09.642077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:09.706619Z","title":"robot_pushed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:09.706619Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:07ffd80ee65cff1728cba5ba9e66147c36dbf48604171ff2c5a040990a6f26d0","observation_id":"ddfca20e-1655-4c33-ac83-8b263a5b037e","resolution":{"observed_at":"2026-08-01T12:49:09.706619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:09.751858Z","title":"Outcomes reached after disengagement, via ghost contact, teleport, or autonomous motion are FALSE","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:09.751858Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:155ed09e556c93292be96713679bd4386a0a52db6b2a6f25add057a9e65f2d94","observation_id":"fdc01ae2-3c49-4693-b456-1c166504bdcb","resolution":{"observed_at":"2026-08-01T12:49:09.751858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:09.789865Z","title":"Hovering near","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:09.789865Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:f8ef36bc944efbb10bafb5f62c62f0f3df18ad16f600a5974a131876d41fe5f7","observation_id":"a6af23b8-78ba-4f05-af0b-73a5d0d03040","resolution":{"observed_at":"2026-08-01T12:49:09.789865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:49:09.834338Z","title":"Penalize teleporting, morphing, gripper passing through solids, vanishing or duplicated objects, frame-to-frame 18 jumps, ghost contact, post-disengagement coasting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:09.834338Z"},"links":{"citing_paper":"/paper/2607.19343"},"observation_digest":"sha256:3fefc7ec2535d695293ef7119ac1499fc4e94b609ca470f3f346dd1f495451d6","observation_id":"7ab1c18a-7e90-414e-93a6-5b710927f094","resolution":{"observed_at":"2026-08-01T12:49:09.834338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19343","last_updated":"2026-07-21T17:59:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T07:25:27.980281Z","submitted_at":"2026-07-21T17:59:11Z","title":"Masked Visual Actions for Unified World Modeling"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":92,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 1 inbound Pith citation observation for arXiv:2607.19343."}