{"as_of":"2026-08-08T15:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e631013cf16a9304f0a35483ddf6cff1f7eff623cb136d9c33bcf63e9bbbdd0","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:29:15.643608Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23969/citation-record","integrity":"/paper/2607.23969/integrity","json":"/paper/2607.23969/citation-record.json","paper":"/paper/2607.23969"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-07-31T23:29:08.487323Z","title":"arXiv preprint arXiv:1803.10122 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:08.487323Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:ada734be82261b9651855f7344c2308b0bf7e1b607d4a3194928deb97d3337d9","observation_id":"9aff173a-cffe-41b2-aac0-242cf82c2341","resolution":{"observed_at":"2026-07-31T23:29:08.487323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:08.539120Z","title":"2, 2022-06-27 , author=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:08.539120Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:c90e5fc9b6e632765cf20ebf71a6f66ce58733e2836f59c34e84a1cc660bc309","observation_id":"f8ade7d5-abc8-49c6-93ce-2f5af0c5865a","resolution":{"observed_at":"2026-07-31T23:29:08.539120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-07-31T23:29:08.629120Z","title":"arXiv preprint arXiv:2301.04104 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:08.629120Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:7333bd1680094634aac457885e745ec87ea16d16ca553e345299d77027410187","observation_id":"e9d560b5-3f26-4b70-bb7c-cec86433b3af","resolution":{"observed_at":"2026-07-31T23:29:08.629120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-07-31T23:29:08.701529Z","title":"arXiv preprint arXiv:2602.15922 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:08.701529Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:7e826750bf56fb8dcf31736badbd515c3e366622245047bd073c7f5ef9e24c30","observation_id":"2e38f635-3de2-4ebd-a6bd-60dafbbec58a","resolution":{"observed_at":"2026-07-31T23:29:08.701529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16732","last_updated":"2026-06-25T19:54:02Z","snapshot_observed_at":"2026-08-07T10:54:05.573771Z","submitted_at":"2025-10-19T07:12:32Z","title":"A Comprehensive Survey on World Models for Embodied AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.16732","snapshot_observed_at":"2026-07-31T23:29:08.784100Z","title":"arXiv preprint arXiv:2510.16732 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:08.784100Z"},"links":{"cited_paper":"/paper/2510.16732","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:72928c0996865b285a93de384db71b888b469465721a11935f7b5f44496c5ea7","observation_id":"ca650434-0e48-4899-907d-2d7c16a96f58","resolution":{"observed_at":"2026-07-31T23:29:08.784100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-31T23:29:08.872529Z","title":"arXiv preprint arXiv:2605.12090 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:08.872529Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:79866c1ea1c7fb69466810c53f44abea9e2f61539f768a4f4fed2a07b64605db","observation_id":"592bd980-22c4-4a8e-b128-40f099c00b37","resolution":{"observed_at":"2026-07-31T23:29:08.872529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-07-31T23:29:08.958122Z","title":"arXiv preprint arXiv:2603.16666 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:08.958122Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:fbcaf7f44bb85f02fbe7e90b110b0b0988e97097bc8235eac8662bae014f7950","observation_id":"c44d2b7e-8205-4087-bb94-478f1ec11ba7","resolution":{"observed_at":"2026-07-31T23:29:08.958122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00078","last_updated":"2026-04-30T14:16:15Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T14:16:15Z","title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00078","snapshot_observed_at":"2026-07-31T23:29:09.068666Z","title":"7: A Latent World-Action Model from Egocentric Videos , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.068666Z"},"links":{"cited_paper":"/paper/2605.00078","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:bcdcbc0ccafb63370905df6f6613dbee8a8dc0566bbd42ac658f405c55e86719","observation_id":"f8e5d28b-23fd-4785-974e-ee95fc68cdce","resolution":{"observed_at":"2026-07-31T23:29:09.068666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:09.156371Z","title":"2024 IEEE International Conference on Robotics and Automation (ICRA) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.156371Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:135f4aa070ac5e6f60b21d935461b2946cb21de7356107ceaf65dc7f65cfda57","observation_id":"b05ffa71-cbb4-4d0b-a0a5-8bc971ecb44d","resolution":{"observed_at":"2026-07-31T23:29:09.156371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:09.207983Z","title":"arXiv preprint arXiv:2512.05230 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.207983Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:0b660c6cad6ce5f1f00f5e60a0ef7abaf8e166bcf495963a3732ce4bb9d4ae4c","observation_id":"b9442ec6-bef4-4c0c-a402-c7d2175e9849","resolution":{"observed_at":"2026-07-31T23:29:09.207983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:09.285517Z","title":"Neural Processing Letters , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.285517Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:f87d99ab4c2e85b49a31094b6cb88fefaa7c925bd61a36422d7d1acb2e477ebc","observation_id":"b6377b33-8772-4ac9-81ea-d41e72ba9f84","resolution":{"observed_at":"2026-07-31T23:29:09.285517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06665","last_updated":"2024-04-29T23:21:33Z","snapshot_observed_at":"2026-07-06T17:28:10.554625Z","submitted_at":"2024-02-06T17:15:33Z","title":"The Essential Role of Causality in Foundation World Models for Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06665","snapshot_observed_at":"2026-07-31T23:29:09.364817Z","title":"arXiv preprint arXiv:2402.06665 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.364817Z"},"links":{"cited_paper":"/paper/2402.06665","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:b0c5bf2ee01fdf6ee72759747c2c062c2c4a34f6075ec0c9d6c4ff2bc7fe7fac","observation_id":"bce56086-4343-4cd1-be26-21ca97ff959b","resolution":{"observed_at":"2026-07-31T23:29:09.364817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19312","last_updated":"2026-06-03T18:50:40Z","snapshot_observed_at":"2026-08-06T05:42:53.129146Z","submitted_at":"2026-03-13T19:48:14Z","title":"LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.19312","snapshot_observed_at":"2026-07-31T23:29:09.447648Z","title":"arXiv preprint arXiv:2603.19312 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.447648Z"},"links":{"cited_paper":"/paper/2603.19312","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:ebee40859c7be09a709ecbb9e9186ac3f768fa5ea34b5c8af6909ec516c8a9df","observation_id":"fc252f21-92a7-47bc-a17e-e9abef623254","resolution":{"observed_at":"2026-07-31T23:29:09.447648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:09.502380Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.502380Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:59685c7cfde8c9db7d42893295220519e598f0a764e9c87d8099280343d4f036","observation_id":"1316bebe-084d-4828-87c7-341cd7514b87","resolution":{"observed_at":"2026-07-31T23:29:09.502380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:09.549040Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.549040Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:e0fd513b8f4139b798f1590e8ed74fd0b971084383103b8b72f2fa430e89e831","observation_id":"5257fef1-1b3d-4027-82e0-d3327da60c9a","resolution":{"observed_at":"2026-07-31T23:29:09.549040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:09.627175Z","title":"arXiv preprint arXiv:2602.10098 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.627175Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:172a05069dabe33414d7021179fad0a948180698c78f09238030cfdb1e028d9e","observation_id":"9f387056-8794-4540-8385-91c32c0f6db0","resolution":{"observed_at":"2026-07-31T23:29:09.627175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:09.682458Z","title":"2019 IEEE/RSJ international conference on intelligent robots and systems (IROS) , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.682458Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:954005bc53d91163a84aca1bd9ee54040b273f6ad6305cbf0bed2751154012a9","observation_id":"2a34f9db-fab6-43ff-afe8-bf52eaa08840","resolution":{"observed_at":"2026-07-31T23:29:09.682458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11215","last_updated":"2020-01-02T06:26:37Z","snapshot_observed_at":"2026-07-06T08:31:59.314616Z","submitted_at":"2019-10-24T15:20:03Z","title":"RoboNet: Large-Scale Multi-Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11215","snapshot_observed_at":"2026-07-31T23:29:09.743324Z","title":"arXiv preprint arXiv:1910.11215 , year=","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.743324Z"},"links":{"cited_paper":"/paper/1910.11215","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:6e3c2ad7a8d6b2c69610918330184d379771384bcda53d8a18f5988b967b1b9b","observation_id":"b497753b-9553-4b5f-b3a8-52015657d192","resolution":{"observed_at":"2026-07-31T23:29:09.743324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:09.804901Z","title":"2024 IEEE International Conference on Robotics and Automation (ICRA) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.804901Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:4f23226f1ff053a34da7aa882d442d157f2ce60df79c55589a34e0809ba5439c","observation_id":"04620409-6d04-4f5b-9d78-80dbd7025ffb","resolution":{"observed_at":"2026-07-31T23:29:09.804901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16098","last_updated":"2023-11-27T18:59:25Z","snapshot_observed_at":"2026-07-30T21:15:46.584759Z","submitted_at":"2023-11-27T18:59:25Z","title":"On Bringing Robots Home","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16098","snapshot_observed_at":"2026-07-31T23:29:09.863046Z","title":"arXiv preprint arXiv:2311.16098 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.863046Z"},"links":{"cited_paper":"/paper/2311.16098","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:a211a8e1f946a4fc218ffcce23c4ab947206428b02d08180a5b1a34d30688bf8","observation_id":"1cc235e7-8466-4e5e-81be-1ccfb4d1c422","resolution":{"observed_at":"2026-07-31T23:29:09.863046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:09.937945Z","title":"Conference on Robot Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:09.937945Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:7fd0ac1385d8f7a2df861f7ffdeaa9694d87fcffc7df6479108d287e2f471e13","observation_id":"94bb5d9a-4606-4814-b50b-45c06a939c4e","resolution":{"observed_at":"2026-07-31T23:29:09.937945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-31T23:29:10.035777Z","title":"arXiv preprint arXiv:2212.06817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.035777Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:21e4a50d187ce4be2d3df679b815669dac009754b3e3acc851735246df3e81d7","observation_id":"0b28176d-abae-434c-84da-f67c9b9a1eff","resolution":{"observed_at":"2026-07-31T23:29:10.035777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-31T23:29:10.097057Z","title":"arXiv preprint arXiv:2406.09246 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.097057Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:9f5093d42f144069e05816e2f510320fefcf160683e1ab45ee83e0f170bf3a67","observation_id":"46c3a552-a2a3-45f4-8c1c-54715abb1827","resolution":{"observed_at":"2026-07-31T23:29:10.097057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-07-31T23:29:10.176384Z","title":"arXiv preprint arXiv:2412.03555 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.176384Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:5c7a0e885e0e9d5dfa9a35d3459d243af09bc032f7396623545966d6b3eca67e","observation_id":"b9ee239f-4d54-45fe-90f9-603c9dbc0b92","resolution":{"observed_at":"2026-07-31T23:29:10.176384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-06T02:17:30.272046Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14818","snapshot_observed_at":"2026-07-31T23:29:10.232317Z","title":"arXiv preprint arXiv:2501.14818 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.232317Z"},"links":{"cited_paper":"/paper/2501.14818","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:b8aa52f3e75f5d6c68a9c6896d5de9570f0c446800ef9276d933aaa919699e09","observation_id":"f2480c1d-4f46-46f1-8207-fa855b5c8fbd","resolution":{"observed_at":"2026-07-31T23:29:10.232317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-31T23:29:10.290017Z","title":"arXiv preprint arXiv:2409.12191 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.290017Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:7a78f1ac9609ddde949705ef2f6f5b7abd2b7f0a93d28900e491acfdbbd7d485","observation_id":"deb53c9f-d945-40f5-9f2a-8a9b3b7013dc","resolution":{"observed_at":"2026-07-31T23:29:10.290017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:10.356380Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.356380Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:54d657b2395a82b2dc461a11b2ba7725205284730a3bc5e42af6d2c3496c6c20","observation_id":"a1774f11-72f9-483c-bb90-7f581f2d4827","resolution":{"observed_at":"2026-07-31T23:29:10.356380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:10.414184Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.414184Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:1df5f33ed66940ac606645e191bc89f15accea89edf19bd54565e06065efb3f9","observation_id":"bcaf1dce-c122-49b5-bce8-6713156d8164","resolution":{"observed_at":"2026-07-31T23:29:10.414184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:10.487635Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.487635Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:1e4f0357bfc0ec282506bd3355d10c54ce44320b042cca388f22def0fd0be14e","observation_id":"7b80d216-ffd2-488e-9e42-99deddea74db","resolution":{"observed_at":"2026-07-31T23:29:10.487635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-07-31T23:29:10.547817Z","title":"arXiv preprint arXiv:2501.15830 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.547817Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:fd750ebf7a14d0b1cb9265a48f4f901b51dd2a949658360a088190d83f91215a","observation_id":"633cbba2-7f07-4798-9534-79342ba3ad9f","resolution":{"observed_at":"2026-07-31T23:29:10.547817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-07-31T23:29:10.626611Z","title":"arXiv preprint arXiv:2503.14734 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.626611Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:c72141b4a2ddbecbc152a748dd28e561be8d7b2c79fb3ae7a31ad1663d5ebc1f","observation_id":"540a43cb-a0a5-4639-8722-5567ea48b787","resolution":{"observed_at":"2026-07-31T23:29:10.626611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-31T23:29:10.712814Z","title":"arXiv preprint arXiv:2507.15597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.712814Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:7d17fc944dc88b5ea8d7fe07cdcb9c0cd77c9162da17edbe70e43e23fe5a2cf4","observation_id":"baf6ea43-c392-463e-9ea5-59d2c684839b","resolution":{"observed_at":"2026-07-31T23:29:10.712814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:10.754206Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.754206Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:b53fc047a7d3a03e5b18a0c62ca5238c021fc8b76b2caa1d0fd482d1d8da5e00","observation_id":"b26ba6a8-4c94-48dd-9b1d-952ca755f278","resolution":{"observed_at":"2026-07-31T23:29:10.754206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-07-31T23:29:10.806179Z","title":"arXiv preprint arXiv:2411.19650 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.806179Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:b1774be0fa41f7e46df349e6f0ddab95d287d090cdb0b2b036d86285a7802fe6","observation_id":"ce6ceb5a-de04-48ff-8ea9-3a47d9ba1756","resolution":{"observed_at":"2026-07-31T23:29:10.806179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20072","last_updated":"2026-05-31T15:50:43Z","snapshot_observed_at":"2026-08-05T15:11:00.360328Z","submitted_at":"2025-08-27T17:39:11Z","title":"Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20072","snapshot_observed_at":"2026-07-31T23:29:10.917183Z","title":"arXiv preprint arXiv:2508.20072 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.917183Z"},"links":{"cited_paper":"/paper/2508.20072","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:7193af8447b19221cb46814a2fa1725a0938e25de9e52e1ae330144849b4533c","observation_id":"6bee72de-6074-4110-b49e-f341aa860f36","resolution":{"observed_at":"2026-07-31T23:29:10.917183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:10.996779Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.996779Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:de3a3ceb1ca21942a5100c33e4cfe4d7f452143df85d4e3117f3bf0acb421aac","observation_id":"8e8c1220-ad05-4df1-9c15-daa20713eac0","resolution":{"observed_at":"2026-07-31T23:29:10.996779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-07-31T23:29:11.038884Z","title":"arXiv preprint arXiv:2502.05855 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.038884Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:730c41151637aa3b1c6efa71a9fa0c24bdd86f0fece26afd3acf64c9a3fa9594","observation_id":"b14307ff-a8ba-4faa-85eb-e5be23bd6177","resolution":{"observed_at":"2026-07-31T23:29:11.038884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:11.103303Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.103303Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:406c153d83fde9f3d28ebfc1b422bc61cfc65f4da8e175a3a9604c862b08151c","observation_id":"c5f0c356-c974-4be1-ab9f-2fe91aaa650e","resolution":{"observed_at":"2026-07-31T23:29:11.103303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:11.172016Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.172016Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:da9c30e80d4e191d333921da5a6a26d687231437121ee360c2588289e7a517e0","observation_id":"9a174fc2-2bb8-4c1e-be67-b2896b226c41","resolution":{"observed_at":"2026-07-31T23:29:11.172016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-07-31T23:29:11.223743Z","title":"arXiv preprint arXiv:2407.08693 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.223743Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:0fee8a5f2eea3bbafcfcabc9041eba3f71698fcdf97a466b3318001c427e3f92","observation_id":"4791e7da-433e-4373-8941-436fefa8aca3","resolution":{"observed_at":"2026-07-31T23:29:11.223743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:11.281446Z","title":"arXiv preprint arXiv:2505.11917 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.281446Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:a1302aec491fd78c2606d4eff46e0c08c49bdadd3ad2c77bdde79821242e23f8","observation_id":"7b2df35d-bb80-4ec3-a3bc-a7b102b7579f","resolution":{"observed_at":"2026-07-31T23:29:11.281446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03729","last_updated":"2025-02-11T04:51:45Z","snapshot_observed_at":"2026-08-04T03:57:28.937418Z","submitted_at":"2025-02-06T02:43:23Z","title":"Action-Free Reasoning for Policy Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03729","snapshot_observed_at":"2026-07-31T23:29:11.330797Z","title":"arXiv preprint arXiv:2502.03729 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.330797Z"},"links":{"cited_paper":"/paper/2502.03729","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:f8bd0069be1a453cf2ce07c94a01a08dca0e45b9f966d5cc8b5ed07555f5b4ee","observation_id":"a0a6036c-4741-403c-8cff-b6b1e00e4028","resolution":{"observed_at":"2026-07-31T23:29:11.330797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:11.402428Z","title":"arXiv preprint arXiv:2510.12276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.402428Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:f8edec02c7d600b4e1028729100d5af07c9b417c3af98cf64cfef7958dd41d27","observation_id":"6e7d83b2-e3d0-4783-a15f-f3cdf5a3900e","resolution":{"observed_at":"2026-07-31T23:29:11.402428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:11.455466Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.455466Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:746787275f4aa103c32bee6f99d16f69b7448b91f2847e40000f4aaa33a3ee05","observation_id":"47e1f208-e676-4de5-9039-c428583ad788","resolution":{"observed_at":"2026-07-31T23:29:11.455466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:11.513635Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.513635Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:b3fdc24e20a699ce405b320a25f738df0ea61e26fdec0778de9eaa3d313ae9fa","observation_id":"c05cde0f-6701-44d0-b750-a099caf9b46b","resolution":{"observed_at":"2026-07-31T23:29:11.513635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:11.583499Z","title":"Robotics research: volume 1 , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.583499Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:9c6d11e13db94ec387d78b9c6ee49a130d49f4c62c5f5266149740f7cf74b801","observation_id":"65a4736d-5364-429b-b4e2-d6f8c40c1018","resolution":{"observed_at":"2026-07-31T23:29:11.583499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-07-31T23:29:11.642958Z","title":"arXiv preprint arXiv:2508.07917 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.642958Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:4667e9c062f300d205e4b886f1d915985a62d885b267d4fd7edf09238277fc7e","observation_id":"f6e052ac-a83c-430f-a307-8207af62625b","resolution":{"observed_at":"2026-07-31T23:29:11.642958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-03T01:29:14.204066Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20540","snapshot_observed_at":"2026-07-31T23:29:11.734740Z","title":"arXiv preprint arXiv:2601.20540 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.734740Z"},"links":{"cited_paper":"/paper/2601.20540","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:9488b91dabd00ec16ba8cdfbe433ebb2eeb7a73bf51fdcb3648bc3cee6fd7a8a","observation_id":"d127496d-5879-4a55-988c-0c5293ff1fdb","resolution":{"observed_at":"2026-07-31T23:29:11.734740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-07-31T23:29:11.777313Z","title":"arXiv preprint arXiv:2412.14803 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.777313Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:dcedad1d57c61f6fa3ecaff97bb8a48dc0e54ad22cb3fd76dab21463614cd924","observation_id":"b43486b3-2ca8-43ae-baf7-428e434791cc","resolution":{"observed_at":"2026-07-31T23:29:11.777313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15692","snapshot_observed_at":"2026-07-31T23:29:11.861166Z","title":"arXiv preprint arXiv:2512.15692 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.861166Z"},"links":{"cited_paper":"/paper/2512.15692","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:6cad37c045001cf33141b8fd9ac499d4daf98e2def501e5514b4359c10488033","observation_id":"52d2263b-5a80-4648-b2c6-c6a21b28f331","resolution":{"observed_at":"2026-07-31T23:29:11.861166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12898","last_updated":"2025-12-20T02:16:12Z","snapshot_observed_at":"2026-07-30T09:36:32.113048Z","submitted_at":"2025-07-17T08:31:55Z","title":"Vidar: Embodied Video Diffusion Model for Generalist Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12898","snapshot_observed_at":"2026-07-31T23:29:11.912385Z","title":"arXiv preprint arXiv:2507.12898 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:11.912385Z"},"links":{"cited_paper":"/paper/2507.12898","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:80ec542eb0fe0e79cd95d6b82b9e2807e05df2b85d20a0488c21996a1b532c46","observation_id":"a9e56a06-1f2e-487e-bd9e-5f20e4c0aee8","resolution":{"observed_at":"2026-07-31T23:29:11.912385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-07-31T23:29:12.001466Z","title":"arXiv preprint arXiv:2508.05635 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.001466Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:9a338a56e5eabddbbefcf051b59f610e5a9f86554762cdb1e59ad221600c6d33","observation_id":"55f901e4-ba58-4b7c-96b3-995629d11039","resolution":{"observed_at":"2026-07-31T23:29:12.001466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-07-31T23:29:12.065410Z","title":"arXiv preprint arXiv:2503.00200 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.065410Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:d898db824e1627be43792cd733bc8f78361831f2a21a01f5401cf979bae3e17e","observation_id":"6c145d1f-da87-40bf-81a5-32ff43a9ed75","resolution":{"observed_at":"2026-07-31T23:29:12.065410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02792","snapshot_observed_at":"2026-07-31T23:29:12.130740Z","title":"arXiv preprint arXiv:2504.02792 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.130740Z"},"links":{"cited_paper":"/paper/2504.02792","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:d8b65a1f1c0f7132d38384b7cf15f2be984561e0b6175fb99da9a09ac4f22494","observation_id":"6f7a5459-6d18-4623-9f02-c9b4cb7907e9","resolution":{"observed_at":"2026-07-31T23:29:12.130740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00795","last_updated":"2025-08-01T17:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-01T17:23:49Z","title":"Video Generators are Robot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00795","snapshot_observed_at":"2026-07-31T23:29:12.206357Z","title":"arXiv preprint arXiv:2508.00795 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.206357Z"},"links":{"cited_paper":"/paper/2508.00795","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:29f6d4f429d689db561604be353a50a8f9442457f23ab85fd9dba4d761b9c5a8","observation_id":"f84571dd-c72b-4b10-9976-8574fe66b7aa","resolution":{"observed_at":"2026-07-31T23:29:12.206357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:12.302698Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.302698Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:ee3efe7637e157da57843a92ad490926f2281d12f8f3fafada189b6041dd729c","observation_id":"7ea2fea6-c798-4885-9833-69c3d9f4c792","resolution":{"observed_at":"2026-07-31T23:29:12.302698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:12.357742Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.357742Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:f24dd08155793ae4da3a1434f764d8765b202ce5e9fc75c70df01ddd7401c53b","observation_id":"e04f0503-1fb7-4e65-aa96-579073383b62","resolution":{"observed_at":"2026-07-31T23:29:12.357742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-07-31T23:29:12.473260Z","title":"arXiv preprint arXiv:2601.16163 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.473260Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:0bbb6e73753c2be8ca5b02aa561dfab03358bc3c2b932ebe5956db2bd3de86be","observation_id":"b0f11994-c9be-4065-9db3-700f62ffc450","resolution":{"observed_at":"2026-07-31T23:29:12.473260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-07-31T23:29:12.535002Z","title":"arXiv preprint arXiv:2601.21998 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.535002Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:4254b45dcf406a7370edffa42a99a9bc3c6829445209154eb562659a5988fdfe","observation_id":"fe3a07d4-e677-4e72-b750-f791f17eb3d6","resolution":{"observed_at":"2026-07-31T23:29:12.535002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:12.622839Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.622839Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:17f665742f6bc890a203c5afa32156e618c71177034f6c9e6715ca648d7ca1c9","observation_id":"f2e9edac-babb-4e70-99e7-ce64fbaeee98","resolution":{"observed_at":"2026-07-31T23:29:12.622839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-07-31T23:29:12.680623Z","title":"arXiv preprint arXiv:2506.18088 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.680623Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:4a46c021303685d545f4d7431ae4ccb17207a58b355746c318dbd37c737b40d5","observation_id":"82b0b169-6333-4ebe-85e5-29f67b301cad","resolution":{"observed_at":"2026-07-31T23:29:12.680623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:12.779049Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.779049Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:1c69d4a4b6a4ee2543d0bbfab20a4b80dc5881eee89ccb7658f91f15e54a54f7","observation_id":"3c3df148-5809-48ff-8f42-f9548005a7f4","resolution":{"observed_at":"2026-07-31T23:29:12.779049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01455","last_updated":"2024-06-14T21:09:49Z","snapshot_observed_at":"2026-07-06T16:42:19.938941Z","submitted_at":"2023-11-02T17:59:21Z","title":"RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01455","snapshot_observed_at":"2026-07-31T23:29:12.862507Z","title":"arXiv preprint arXiv:2311.01455 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.862507Z"},"links":{"cited_paper":"/paper/2311.01455","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:54f927816351c39ee82fee202b7f2c6fbf8d682e18c1a3a5ea56203e6f4a4b70","observation_id":"368ae7db-1e29-4b2d-a3a5-e977e317cd82","resolution":{"observed_at":"2026-07-31T23:29:12.862507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-31T23:29:12.915500Z","title":"arXiv preprint arXiv:2401.09985 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.915500Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:40c13245bb772e8031daa8ee243cbba9258078f0af8a1caedd8c5fd301d91752","observation_id":"08b1164e-9f3f-4ef8-a680-bade7b797e1f","resolution":{"observed_at":"2026-07-31T23:29:12.915500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:13.014425Z","title":"Conference on Robot Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.014425Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:e77d21d948e1221d838da96298a6836fb42bdea55863ac77c7e83e57d4411df0","observation_id":"80aaf03e-e55d-4701-a1eb-1ac4d5d2bab4","resolution":{"observed_at":"2026-07-31T23:29:13.014425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:13.089413Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.089413Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:f768fd3b1ccaae5ca03c063636fbdfbae0bff419d7f0af8cc1c0f2d56b27a0cb","observation_id":"6553ad93-e38e-42b2-84d3-91595c74ce81","resolution":{"observed_at":"2026-07-31T23:29:13.089413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-07T02:30:11.447693Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-07-31T23:29:13.143581Z","title":"arXiv preprint arXiv:2404.08471 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.143581Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:84550df3b849c87b6fd1c7d0f4d8c4cae7a0a0d367d498af84e7a7c99754d169","observation_id":"d9fd9978-ad21-4f9e-a293-01d4bb706956","resolution":{"observed_at":"2026-07-31T23:29:13.143581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:13.245678Z","title":"2024 IEEE International Conference on Robotics and Automation (ICRA) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.245678Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:f20add4570d2d36085c770d9b24025c3231a044890cbb3cd8587195c6010e1db","observation_id":"9733fde8-614c-461b-817f-41e025874933","resolution":{"observed_at":"2026-07-31T23:29:13.245678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.00678","last_updated":"2026-07-06T08:13:44Z","snapshot_observed_at":"2026-08-08T11:30:57.947234Z","submitted_at":"2026-07-01T09:21:20Z","title":"ABot-M0.5: Unified Mobility-and-Manipulation World Action Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.00678","snapshot_observed_at":"2026-07-31T23:29:13.348512Z","title":"5: Unified Mobility-and-Manipulation World Action Model , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.348512Z"},"links":{"cited_paper":"/paper/2607.00678","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:06189adbe9f2e23ee43a15384193fa66113410a7614d5525591419983286193d","observation_id":"764fb515-1074-4f22-ac24-8d367375fe88","resolution":{"observed_at":"2026-07-31T23:29:13.348512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:13.416529Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.416529Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:5950c67034339337eef90fcf9bfb91a1f10e878167c0e12d2f9f8d76c60fa770","observation_id":"1fffe45e-d672-451c-9adf-8879482907f9","resolution":{"observed_at":"2026-07-31T23:29:13.416529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-07-31T23:29:13.476375Z","title":"arXiv preprint arXiv:2203.12601 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.476375Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:24aca4f1a359e2efa99e75164db87a02927254854efe7290d7df0354cb5178c3","observation_id":"3bd135a8-d2ee-4b77-86a5-d593ad63abb1","resolution":{"observed_at":"2026-07-31T23:29:13.476375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:13.536505Z","title":"arXiv preprint arXiv:2512.17909 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.536505Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:adbebd35b8c7ed9904239016e732505b73c6c0cbbc9a51647609c85725c2d44e","observation_id":"de823867-7ed9-41cc-9009-9fcca3e65e63","resolution":{"observed_at":"2026-07-31T23:29:13.536505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-07-31T23:29:13.609223Z","title":"arXiv preprint arXiv:2204.06125 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.609223Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:e71061d50569432a54806af3e2a67ee1e584b2f387e0b128828e087b0c15b773","observation_id":"20f0f3b4-b174-4473-bab8-fe126e6e5288","resolution":{"observed_at":"2026-07-31T23:29:13.609223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:13.683357Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.683357Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:2acc6cd94dd5f000f8d086e5365f5137fdd99391dbeb017d6e80f180bfc662e9","observation_id":"701e957a-ea96-4280-af8b-aad1ebe8b5e3","resolution":{"observed_at":"2026-07-31T23:29:13.683357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:13.733177Z","title":"Forty-first international conference on machine learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.733177Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:3010e6f79581651e819874e48b83a39f0767bfd8116cb485a557e938bf4542ca","observation_id":"45734156-af5f-46f1-93b3-e5f0d13951f4","resolution":{"observed_at":"2026-07-31T23:29:13.733177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-07-31T23:29:13.827099Z","title":"arXiv preprint arXiv:2310.06114 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.827099Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:5be25f66ae3a39fceb10f9144417a39ad85d7733d491be181ffed08ed7bf7f75","observation_id":"67d60bba-339f-4004-9487-d2f4347b3a80","resolution":{"observed_at":"2026-07-31T23:29:13.827099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.02722","last_updated":"2021-01-07T19:03:34Z","snapshot_observed_at":"2026-08-06T20:03:52.435962Z","submitted_at":"2021-01-07T19:03:34Z","title":"The Distracting Control Suite -- A Challenging Benchmark for Reinforcement Learning from Pixels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.02722","snapshot_observed_at":"2026-07-31T23:29:13.904203Z","title":"arXiv preprint arXiv:2101.02722 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.904203Z"},"links":{"cited_paper":"/paper/2101.02722","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:3e84b9ecaebde0f738fcf3f4bd52b72e07d237845ca70c71fa2f86a930d19f90","observation_id":"0404c085-dca3-45b9-8cef-b4cc906912fe","resolution":{"observed_at":"2026-07-31T23:29:13.904203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:13.945562Z","title":"2021 IEEE International Conference on Robotics and Automation (ICRA) , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:13.945562Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:f337941cb6605b5d5de3fce521188eb8c13a3e00f24793da6531529a1250ea39","observation_id":"10d26ad0-1d6a-4f17-a91e-4384c91aa0d1","resolution":{"observed_at":"2026-07-31T23:29:13.945562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:14.025908Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:14.025908Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:f83dd3ac393c78b4ea351d9c3c6ffda75a933e11ece320cddddc734f9e87da08","observation_id":"12dbddb7-0f52-4e13-8fd6-1ec5d2bd043d","resolution":{"observed_at":"2026-07-31T23:29:14.025908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-07-31T23:29:14.109837Z","title":"arXiv preprint arXiv:2505.06111 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:14.109837Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:51e1cf8e5e9b9e448cd6c46e659971c6b8f3de61150e86c23d43e20eb7a5c12a","observation_id":"465c50b9-4d63-4644-bed8-7388d853ed0f","resolution":{"observed_at":"2026-07-31T23:29:14.109837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-31T23:29:14.195412Z","title":"arXiv preprint arXiv:2410.24164 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:14.195412Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:4a264aab2f17d64155bb4a0ada26629403b635e2c79d1ac16a1f7e02077c0a53","observation_id":"2a0e341b-a921-4d4a-a6b7-518f8afd5947","resolution":{"observed_at":"2026-07-31T23:29:14.195412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-07-31T23:29:14.255716Z","title":"arXiv preprint arXiv:2501.09747 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:14.255716Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:59b23ca0cf868fab434212856539b88ad0f71791390339130356c1b568ce5820","observation_id":"d6f0231a-4cc4-4036-8567-c03fef4938dd","resolution":{"observed_at":"2026-07-31T23:29:14.255716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:14.340521Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:14.340521Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:c0f1bd2483ff6c3550d21e4323727087441d0c677e4ffbeb2ae8a322a7808a80","observation_id":"40c254a8-8412-49c0-9de1-4dd4ed2cfd7c","resolution":{"observed_at":"2026-07-31T23:29:14.340521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-07T12:15:14.265779Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-07-31T23:29:14.406155Z","title":"arXiv preprint arXiv:2506.21539 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:14.406155Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:69e0e6303d0d1a7bb27af78f6e9defc86ee1e002b3a10002ddb4bc4456eaa9d7","observation_id":"c2be8850-3276-46aa-9d01-7ddd151ac2da","resolution":{"observed_at":"2026-07-31T23:29:14.406155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23682","snapshot_observed_at":"2026-07-31T23:29:14.484130Z","title":"arXiv preprint arXiv:2507.23682 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:14.484130Z"},"links":{"cited_paper":"/paper/2507.23682","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:ab2dddb5a3938822c17bf3790f080fab7b12e6691c8edf743b07277385939283","observation_id":"f8469d52-052c-4331-94a1-f7b0fcdf2e2a","resolution":{"observed_at":"2026-07-31T23:29:14.484130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-07-31T23:29:14.581079Z","title":"arXiv preprint arXiv:2502.19645 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:14.581079Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:69635908d98bc88a61c46a9ebf8b07ba12c32bd68288cd799f5fa056e6d33801","observation_id":"3047d48c-f629-4355-b454-3f697a086ab9","resolution":{"observed_at":"2026-07-31T23:29:14.581079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:14.665371Z","title":"International conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:14.665371Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:8631d9b3e32f63c6252639527e523845d46fd40668f3f4ad6aae1841ef15763b","observation_id":"86840a44-33c9-48bb-9291-b8a0bfb8299d","resolution":{"observed_at":"2026-07-31T23:29:14.665371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-07-31T23:29:14.783083Z","title":"arXiv preprint arXiv:2510.13626 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:14.783083Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:9922c7d7ade79d0df45900da2a5d5f1697f1ab6d833fe18964d6c1b33e875fe1","observation_id":"c1a8bea2-8c90-4bb2-b7a4-2aaf750495e6","resolution":{"observed_at":"2026-07-31T23:29:14.783083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:14.871766Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:14.871766Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:12775be7873f42a18e6f4ee00a8777a2a25bd2e66dee0d6d2c2b61a199dfa934","observation_id":"fc76ce2c-d9a3-4b24-857a-8bc1d33b1d8b","resolution":{"observed_at":"2026-07-31T23:29:14.871766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-07-06T22:41:24.948774Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.07060","snapshot_observed_at":"2026-07-31T23:29:14.980347Z","title":"arXiv preprint arXiv:2601.07060 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:14.980347Z"},"links":{"cited_paper":"/paper/2601.07060","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:fa88da65ca7917e759250d930958797cdabd103f4d1af2e23294d6a7b1162eeb","observation_id":"4a8e76f4-c3fd-4009-b867-daefbdc0b30a","resolution":{"observed_at":"2026-07-31T23:29:14.980347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:15.082517Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:15.082517Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:ad484d07e5c773ef7c6d260dab0f5dc9d70cefb3c892f9e6aad923b0a8044822","observation_id":"f1576b06-5cb1-48a3-9f55-0d732a22b789","resolution":{"observed_at":"2026-07-31T23:29:15.082517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11236","snapshot_observed_at":"2026-07-31T23:29:15.145937Z","title":"arXiv preprint arXiv:2602.11236 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:15.145937Z"},"links":{"cited_paper":"/paper/2602.11236","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:b5f8dbabaefc1567c993793e823db938e3fc1e300ae48f8e170882ce644c1e53","observation_id":"de8b90de-0320-45ef-a25e-ba7e7feb28fa","resolution":{"observed_at":"2026-07-31T23:29:15.145937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30280","last_updated":"2026-06-01T13:48:35Z","snapshot_observed_at":"2026-08-04T01:13:02.026321Z","submitted_at":"2026-05-28T17:36:31Z","title":"Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30280","snapshot_observed_at":"2026-07-31T23:29:15.208144Z","title":"arXiv preprint arXiv:2605.30280 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:15.208144Z"},"links":{"cited_paper":"/paper/2605.30280","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:1e1e476a3e87349f9ed927518192a020332eb1e391b4f934df49a5e1e54b267d","observation_id":"ed654650-0329-44d0-ba12-85f5374e20d7","resolution":{"observed_at":"2026-07-31T23:29:15.208144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:15.277999Z","title":"arXiv preprint arXiv:2602.12062 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:15.277999Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:5c9f3826ed6db602805bfa1887ebaa7235559598db6a43d912d54e8164a45994","observation_id":"1d2957e2-16d4-43a3-b7d7-7bcf90ee78af","resolution":{"observed_at":"2026-07-31T23:29:15.277999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13548","last_updated":"2026-06-01T10:46:32Z","snapshot_observed_at":"2026-08-07T20:52:28.800992Z","submitted_at":"2026-05-13T13:55:37Z","title":"AttenA+: Rectifying Action Inequality in Robotic Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13548","snapshot_observed_at":"2026-07-31T23:29:15.346799Z","title":"arXiv preprint arXiv:2605.13548 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:15.346799Z"},"links":{"cited_paper":"/paper/2605.13548","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:8a7dba84359687d37eb75293260f44425998183a8f87c053463cd750a01b26ca","observation_id":"bf2d4617-930d-4f1e-9159-d16013d3e26b","resolution":{"observed_at":"2026-07-31T23:29:15.346799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17846","last_updated":"2026-06-17T17:06:39Z","snapshot_observed_at":"2026-08-01T08:00:11.218777Z","submitted_at":"2026-06-16T12:14:39Z","title":"Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17846","snapshot_observed_at":"2026-07-31T23:29:15.462624Z","title":"arXiv preprint arXiv:2606.17846 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:15.462624Z"},"links":{"cited_paper":"/paper/2606.17846","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:3c95ff2f567ebe1e8b1f1cde70e3c9ef4b949ab72cc7ae7665d747eb6177e595","observation_id":"720b3c77-7128-468e-8bed-864145797870","resolution":{"observed_at":"2026-07-31T23:29:15.462624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19531","snapshot_observed_at":"2026-07-31T23:29:15.579570Z","title":"arXiv preprint arXiv:2606.19531 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:15.579570Z"},"links":{"cited_paper":"/paper/2606.19531","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:72c2e98961998f39dae6dcd93cd1ad71a1594d567a36caf84e195af40ddc09c9","observation_id":"95e3db30-fa90-42e0-8294-3544737834fb","resolution":{"observed_at":"2026-07-31T23:29:15.579570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:29:15.643608Z","title":"arXiv preprint arXiv:2602.11832 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:15.643608Z"},"links":{"citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:57ff1a9ae5da3ad0ff241f53910e651ee26d4c3b5723d4e5a3ddcf7abfc4186d","observation_id":"98783439-de9c-4186-ac36-0dc7afd5d730","resolution":{"observed_at":"2026-07-31T23:29:15.643608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 0 inbound Pith citation observations for arXiv:2607.23969."}