{"as_of":"2026-08-08T02:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f558ca864267f1d8209567f05785d883f5296b71437ab1020d5e4b03b6e31b65","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:07:24.277177Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.06006/citation-record","integrity":"/paper/2506.06006/integrity","json":"/paper/2506.06006/citation-record.json","paper":"/paper/2506.06006"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.195888Z","title":"Recurrent world models facilitate policy evolution","venue":null,"work_id":"e5a40d38-1825-4240-8ca5-1875e9071f3b","year":2018},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:23.988932Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:79037928f46f42ea99df89cad1a4779bdaf702b761d8e93189f346a9746d8eb3","observation_id":"8863294b-c256-4205-9463-1d4538c03e41","resolution":{"observed_at":"2026-08-07T06:07:25.201072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T06:07:23.995257Z","title":"Cosmos world foundation model platform for physical AI","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:23.995257Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:3653ecd7e03a760708cb9cacc80806f8b8e142d92d792bb99c4561de4ed080f4","observation_id":"4286e6d7-37ae-4216-b2cc-2fbec26dba99","resolution":{"observed_at":"2026-08-07T06:07:23.995257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.001012Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.001012Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:b0d86ade7a3cf86820bcdab362bd38a4be78210ad797bbe936558459399479ac","observation_id":"0ca95a54-c6cc-4406-a062-1c01f424057b","resolution":{"observed_at":"2026-08-07T06:07:24.001012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.166669Z","title":"Video generation models as world simulators","venue":null,"work_id":"aceafd82-4e7d-4b9f-b7c8-3e9d4671c5f4","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.006263Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:16676aa5b2f990e0f00160dd2078937e3ec7c3babc7eead871bc454da56e7c47","observation_id":"7d0c545d-536c-4143-ba7b-cbf786b12461","resolution":{"observed_at":"2026-08-07T06:07:25.173532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18072","last_updated":"2024-10-23T17:56:11Z","snapshot_observed_at":"2026-08-07T10:24:39.020859Z","submitted_at":"2024-10-23T17:56:11Z","title":"WorldSimBench: Towards Video Generation Models as World Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18072","snapshot_observed_at":"2026-08-07T06:07:24.010922Z","title":"WorldSimBench : Towards video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.010922Z"},"links":{"cited_paper":"/paper/2410.18072","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:e23d843c98df70a0165f9e8b100ad7c3450f6264c4f4a0f5a85195e6250fd1d0","observation_id":"ea51fd94-ebf7-46bc-bed2-42afdc6a2250","resolution":{"observed_at":"2026-08-07T06:07:24.010922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.151089Z","title":"Do as I can, not as I say: Grounding language in robotic affordances","venue":null,"work_id":"c323b2ae-8cb6-4c58-b084-d11410679471","year":2023},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.015924Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:410c3fee4564d1e329ac4b1c0b0f91b762f633e57aeeaf0ee1d9d29387771784","observation_id":"7c89477f-64fd-4e9c-acd9-ef939b47b253","resolution":{"observed_at":"2026-08-07T06:07:25.155966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.133172Z","title":"Inner Monologue : Embodied reasoning through planning with language models","venue":null,"work_id":"eb862327-80f6-4920-a83c-c4d4515d4318","year":2022},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.020456Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:4cd3cec3e7b809c43d0d9632905bd96dc24723e962f37e4651c3e1f17dbaf2bc","observation_id":"27e59029-a26d-4f79-bcae-5794c0d4232c","resolution":{"observed_at":"2026-08-07T06:07:25.137732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-02T11:23:33.987927Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-08-07T06:07:24.025967Z","title":"Imagine while reasoning in space: Multimodal visualization-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.025967Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:f62f7b4162e346774232c72dc6e597c96bbb8bba6a6e16e4f507cc4122a1222a","observation_id":"3092e8bf-2fe7-43ca-b59b-c0bbd45e614e","resolution":{"observed_at":"2026-08-07T06:07:24.025967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-07T06:07:24.031045Z","title":"A generalist agent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.031045Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:893f49dca2b1e77d05548815d07fe27d4d87a9e5eb389ccc332c2cc664579fb6","observation_id":"2a29bc56-079a-476f-adc6-e35ffee01026","resolution":{"observed_at":"2026-08-07T06:07:24.031045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-07T06:07:24.035996Z","title":"Learning interactive real-world simulators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.035996Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:809ad2027f575cd7e15588a861075cf98e656bf993ede3e38e0d7c8694483315","observation_id":"32537f05-b388-4691-98de-c7c20ef1cf32","resolution":{"observed_at":"2026-08-07T06:07:24.035996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.118265Z","title":"Mastering diverse control tasks through world models","venue":null,"work_id":"ccafd235-5422-416f-bdd9-382b5f6dde81","year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.042286Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:dc8d10fc2fef1aef654220f90c688f9527878170234c90eb36064cc1a410e902","observation_id":"78cea173-cdcd-4395-8461-ecbc2d080cdc","resolution":{"observed_at":"2026-08-07T06:07:25.122718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-07T06:07:24.046755Z","title":"World model on million-length video and language with blockwise RingAttention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.046755Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:6e12333d0f9b2aba36012798307c4adaf1d4f99cfaddecbdbd38fd88ba9eb305","observation_id":"d0ab5390-6057-4e67-ae4b-ba144b5846da","resolution":{"observed_at":"2026-08-07T06:07:24.046755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-02T17:18:33.867969Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09038","snapshot_observed_at":"2026-08-07T06:07:24.051408Z","title":"Do generative video models learn physical principles from watching videos? arXiv preprint arXiv:2501.09038 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.051408Z"},"links":{"cited_paper":"/paper/2501.09038","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:01906cd0007053fde685a33a6061f31eea237e028d343fe8051c70f357f7c05e","observation_id":"d3c9dccb-f84f-44ff-a2fa-27e1dc9191db","resolution":{"observed_at":"2026-08-07T06:07:24.051408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.103118Z","title":"Physically grounded vision-language models for robotic manipulation","venue":null,"work_id":"5ab0c545-8e1b-4288-8f15-47adb8afe6d2","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.056924Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:90761eab5a9a5afa0e343a5d0fb272f2749d582e95dbf087ca4d2afe49b9fae9","observation_id":"6cf3a3ba-b5db-450e-806f-021a7abf32c7","resolution":{"observed_at":"2026-08-07T06:07:25.107730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.087084Z","title":null,"venue":null,"work_id":"59252609-b577-4443-817f-6a23b04376a9","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.061561Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:003a043b744f01026f6b35f2a5cdf1345273b58ef9a58e1e48ee33a0503f5098","observation_id":"69c4f1b3-c04f-4d8c-9e03-c6280b7f88ff","resolution":{"observed_at":"2026-08-07T06:07:25.091676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.071313Z","title":"Can language models encode perceptual structure without grounding? A case study in color","venue":null,"work_id":"921394ed-6004-448c-abc0-383a85e04ec8","year":2021},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.066153Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:eb66fb589e5eeb4411cf09c3ffb1535004e56e00442127f36b0234829ff075b8","observation_id":"85becdf0-b936-4438-b842-bbc53d393128","resolution":{"observed_at":"2026-08-07T06:07:25.075935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T06:07:24.072246Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.072246Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:0968daa5073fe3b01a413de918a66ca10ebae649032426461182ab708e8711b2","observation_id":"3a0aab83-bf9d-49ef-9bf7-5f8aecfbd6df","resolution":{"observed_at":"2026-08-07T06:07:24.072246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.054719Z","title":"Learning Action and Reasoning-Centric Image Editing from Videos and Simulations","venue":null,"work_id":"c8f6898e-9907-46de-9bfc-4512bda9fb72","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.078717Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:81f7e7bf0a3bd7b5ed2e241476cd5deb208009a6d6ae19eb79e1358b3122cbb1","observation_id":"0f58401b-5e6a-42a0-aa18-07a5686137cb","resolution":{"observed_at":"2026-08-07T06:07:25.060218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.038247Z","title":"Video PreTraining (VPT) : Learning to act by watching unlabeled online videos","venue":null,"work_id":"1239b43f-6813-4b19-a7d9-726525cfcda2","year":2022},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.084572Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:af917be3739be8a3be54c1627b018b337c8543db8b3a248f5bdf7a445b9aec9c","observation_id":"01bca877-3c16-4f23-92ba-7269b995fbf4","resolution":{"observed_at":"2026-08-07T06:07:25.043321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.020639Z","title":"Moments in time dataset: one million videos for event understanding","venue":null,"work_id":"3b5b2e6d-38ec-4986-bab3-08c4315c0b39","year":2019},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.094006Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:4bf6d0a7066f9d851231b008e62a046541ad43f0d47d9eb194b7882780c01da4","observation_id":"59a6acba-88a1-4f93-8150-cd732c3975b0","resolution":{"observed_at":"2026-08-07T06:07:25.027199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T06:07:24.106289Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.106289Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:b65075fe2db7557eee7caa1143fea0f31ea5d0327e8687ae509ac92ad4c8d911","observation_id":"6f02e7ac-5174-4f45-ab1a-a94afb616404","resolution":{"observed_at":"2026-08-07T06:07:24.106289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-07T06:07:24.112945Z","title":"A short note on the kinetics-700 human action dataset","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.112945Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:70331dde8879e12152f24a6620cf207a2f9a64449cfa447bf1356d3e65a01474","observation_id":"e580f276-799e-4ede-9b90-7b96d4523b84","resolution":{"observed_at":"2026-08-07T06:07:24.112945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T06:07:24.117780Z","title":"UCF101 : A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.117780Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:862ab91d10a8c1a08abbe0bdd7e5f2accb4c38275bf391ac9b5f18594b946305","observation_id":"addd9681-e6dd-4c3d-9596-6b0341cff92a","resolution":{"observed_at":"2026-08-07T06:07:24.117780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-07T06:07:24.123574Z","title":"VILA-U : a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.123574Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:c12a544768540832bbeb07f15e32e8503fe7b3c18414e20a79603ee92a20f502","observation_id":"845beb56-b69f-4cf9-b273-296b9a23170e","resolution":{"observed_at":"2026-08-07T06:07:24.123574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.004475Z","title":"Scaling egocentric vision: The EPIC-KITCHENS dataset","venue":null,"work_id":"3982e75e-697a-44b9-9345-3260a3338de9","year":2018},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.131233Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:cd53678f391a3729fd9947eeb94700c204ec89b2834b3a33599ad6c64723ee83","observation_id":"b7a16e98-9bca-4d02-9e3f-2ebaeb863cd8","resolution":{"observed_at":"2026-08-07T06:07:25.009280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T06:07:24.139015Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.139015Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:14b34c78f52a0ad6185f61a17dbbce5f30f23ebd522a23e520c706a53d4f8a14","observation_id":"8b21755f-24ef-46e9-81fb-a454489583d8","resolution":{"observed_at":"2026-08-07T06:07:24.139015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T06:07:24.146649Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.146649Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:64d86b99ba456b8f539c36864959d348d173f75c74d26bfd359806e2c1aa2202","observation_id":"cee2bfe3-7a20-43d3-9550-c4581fa7b974","resolution":{"observed_at":"2026-08-07T06:07:24.146649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.988575Z","title":"Kubric: A scalable dataset generator","venue":null,"work_id":"8bef9409-f1ef-44f3-b1e4-1d5835633031","year":2022},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.154506Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:f84d69a7ef5c37fb2de5072b5cb66a3d3e5b0ce13c7f8bdc7426271e1f374f24","observation_id":"abc8ad40-06ad-4a4f-9ead-752ccaf4dcea","resolution":{"observed_at":"2026-08-07T06:07:24.993415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.972222Z","title":"InstructPix2Pix : Learning to follow image editing instructions","venue":null,"work_id":"d04f86aa-d8d0-4e3e-b364-0799d923da8d","year":2023},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.160136Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:e9a4ebda53f61f79ef2b14b8a158a5d350874395bdadf61ee8d1925ba55abf75","observation_id":"d90e9194-b20e-49c3-aa98-da96adc23f23","resolution":{"observed_at":"2026-08-07T06:07:24.978148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T06:07:24.165875Z","title":"GoT : Unleashing reasoning capability of multimodal large language model for visual generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.165875Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:69891c19e242aa5030bcd759e62548b9eaab47e8811df6c974d0c3f510c9988a","observation_id":"e85fb9d6-0103-4439-b9cc-e33646806b97","resolution":{"observed_at":"2026-08-07T06:07:24.165875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.956489Z","title":"SmartEdit : Exploring complex instruction-based image editing with multimodal large language models","venue":null,"work_id":"3b6ef248-390e-40dc-9891-b1ee14a412d4","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.171421Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:04fc8760db7e82209ef5ed966e52f923027532a69b1d3b55720bf24a3f93da49","observation_id":"e0c0d67e-b944-490e-99fc-7cb50afc0217","resolution":{"observed_at":"2026-08-07T06:07:24.961540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.938703Z","title":"BERTScore : Evaluating text generation with bert","venue":null,"work_id":"7cb66679-3afd-4a30-a4dc-67151a587a89","year":2020},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.177171Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:7d15ba1a717d7c23dd29b56f406e3554f7b442afe90a57b43e9f9742fe537178","observation_id":"9f064c14-cceb-4b80-a95a-21b137f4c6f1","resolution":{"observed_at":"2026-08-07T06:07:24.943531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.921465Z","title":"ROUGE : A package for automatic evaluation of summaries","venue":null,"work_id":"b21f9ad9-f600-4fd2-9a7e-5e7cf31c0719","year":2004},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.181794Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:0d6b8b3f671b0591cb095ede515d04eb9f510a11f36d122ee57842aecadf8207","observation_id":"3a054d53-0926-4a4b-8846-47f5df5cce80","resolution":{"observed_at":"2026-08-07T06:07:24.926323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.905556Z","title":"BLEU : a method for automatic evaluation of machine translation","venue":null,"work_id":"24ade54b-8f16-4a4f-985c-af6d4acc44d5","year":2002},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.186374Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:afc695ec86436d12235f603f5a57025343bcc699a3cd13413010f997db84fed1","observation_id":"40bd7703-77e1-4a64-8af0-24e30a93a50c","resolution":{"observed_at":"2026-08-07T06:07:24.910375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.890205Z","title":"Variational best-of-n alignment","venue":null,"work_id":"1a0631c6-336b-4e8b-beba-09d495c1fdd2","year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.192078Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:049b104e243d58db0725b49c2dd50b540673c63713923a855a62c57b564554bc","observation_id":"22b337b0-2348-4812-b120-9203aac9fc09","resolution":{"observed_at":"2026-08-07T06:07:24.894651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.874732Z","title":"Learning to predict by the methods of temporal differences","venue":null,"work_id":"abb6fc25-9a24-44e9-b9ee-54b7acbb6e01","year":1988},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.196626Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:9c4686a8a9c2978b121c1ed4334bf8002d869358d1a1ad73a9574a5abf491256","observation_id":"04175720-5e5d-4a3d-bbb1-8affe0c9027f","resolution":{"observed_at":"2026-08-07T06:07:24.879924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.859129Z","title":"Learning latent dynamics for planning from pixels","venue":null,"work_id":"1ddc61d7-0954-428e-ae70-49b98cd3ffcd","year":2019},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.201635Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:9d5fbd00ed3c8dd9ee7fad28204901218d82b073b8c8c8597af8f1e9651c46f8","observation_id":"d3207217-fac6-436e-a918-954b2067100b","resolution":{"observed_at":"2026-08-07T06:07:24.863771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.843614Z","title":"Transformers are sample-efficient world models","venue":null,"work_id":"3b2115e5-12c2-4819-b0ae-54a68594066a","year":2022},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.206106Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:5ab22fbc80f3f28a847f3896aca8931c6603c7482a463012339f221e9b15706f","observation_id":"e934c709-0463-4043-b79d-342cc8da7aa4","resolution":{"observed_at":"2026-08-07T06:07:24.848709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07109","last_updated":"2023-03-13T13:43:59Z","snapshot_observed_at":"2026-07-06T15:02:36.621143Z","submitted_at":"2023-03-13T13:43:59Z","title":"Transformer-based World Models Are Happy With 100k Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07109","snapshot_observed_at":"2026-08-07T06:07:24.210816Z","title":"Transformer-based world models are happy with 100k interactions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.210816Z"},"links":{"cited_paper":"/paper/2303.07109","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:62f1efd3a85bc1331edf61eb042126a2360bc47bb239087eda46009a8a527304","observation_id":"f5d5c6b4-4972-4c15-90a1-8e701d569918","resolution":{"observed_at":"2026-08-07T06:07:24.210816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.827351Z","title":"Diffusion for world modeling: Visual details matter in atari","venue":null,"work_id":"cad47d20-e061-4ec2-b753-e63f82fe0e4f","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.215773Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:05e4ab610727515a301d58cf4d18cfd975ca9cc4678899fee54cc14335e6fe66","observation_id":"92f9b374-e22a-4e4f-8497-f805085aa920","resolution":{"observed_at":"2026-08-07T06:07:24.832798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.811316Z","title":"Video-LLaVA : Learning united visual representation by alignment before projection","venue":null,"work_id":"d18df7be-fe03-463a-985b-ea8456922add","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.220051Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:0c203c0c1ff1cc847c578ff50f2094b86edb59ede161f6f044f474c8f4c78686","observation_id":"1ec03a46-1e03-43c3-9ea4-a5a150fe8928","resolution":{"observed_at":"2026-08-07T06:07:24.816123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T06:07:24.224463Z","title":"Janus-Pro : Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.224463Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:747f4687b518182cb56b70c168b960d5bca4dbd1632d5884144a22957f927908","observation_id":"0ee50795-2a17-4ce8-b0d3-d58b82240769","resolution":{"observed_at":"2026-08-07T06:07:24.224463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.793756Z","title":"iVideoGPT : Interactive VideoGPTs are scalable world models","venue":null,"work_id":"cd609746-0160-4c74-b2bc-8ef02db79c35","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.229666Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:e2f1e8f689ffa69925c8d26a9bd350e7ef47520257f8b1b4b219f0cb6430a0b8","observation_id":"705237c3-ef8a-4da8-ab19-11f7323d799e","resolution":{"observed_at":"2026-08-07T06:07:24.799182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.775801Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":"c1a46495-af05-4f4b-a882-04716a6ebe20","year":2021},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.234370Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:dd7146fae18816ec8f74e1572d2c57135996d55d27a737c5a83fd345023c173b","observation_id":"3d3f5554-3e1e-4183-b63f-9c8d3a053a5e","resolution":{"observed_at":"2026-08-07T06:07:24.780990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.759319Z","title":"Vision-language models provide promptable representations for reinforcement learning","venue":null,"work_id":"d66918a0-6ad3-41fe-963d-66f3c5f4be03","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.238717Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:48f98024c8af3ce96be56015c7a885039a34a657c5d952c1353781bce3e0f092","observation_id":"0d753bfb-16d2-407e-bd88-cf44f27b7454","resolution":{"observed_at":"2026-08-07T06:07:24.764728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.743170Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":null,"work_id":"7b3b7e81-8e9f-4085-a1e3-5de00945fb86","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.244183Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:6be7f77928fb242489d219232d8c8a42ccf8d3498406b515dd8aad7c2f0492e8","observation_id":"d8e610c3-5eba-4198-89e6-b50ebdb6ae98","resolution":{"observed_at":"2026-08-07T06:07:24.748169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17139","last_updated":"2024-02-27T02:05:29Z","snapshot_observed_at":"2026-08-04T02:50:42.922408Z","submitted_at":"2024-02-27T02:05:29Z","title":"Video as the New Language for Real-World Decision Making","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17139","snapshot_observed_at":"2026-08-07T06:07:24.250329Z","title":"Video as the new language for real-world decision making","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.250329Z"},"links":{"cited_paper":"/paper/2402.17139","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:1d320ed4a7529dcfcfdf3fea30cf83c95050702677b902985e0f62bba3dbfbd1","observation_id":"bd6a97b2-880f-4f4a-81a5-1f4dba080336","resolution":{"observed_at":"2026-08-07T06:07:24.250329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10076","last_updated":"2025-02-09T05:57:42Z","snapshot_observed_at":"2026-08-05T03:06:51.748183Z","submitted_at":"2024-10-14T01:39:56Z","title":"VideoAgent: Self-Improving Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10076","snapshot_observed_at":"2026-08-07T06:07:24.256971Z","title":"VideoAgent : Self-improving video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.256971Z"},"links":{"cited_paper":"/paper/2410.10076","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:1d3f9484539d00ae714a9693a7214b271ec74ec470fec817f7b02a95d952d7f9","observation_id":"13d75b34-ae20-4441-806d-4682344e22b4","resolution":{"observed_at":"2026-08-07T06:07:24.256971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06135","last_updated":"2024-07-08T17:08:02Z","snapshot_observed_at":"2026-07-06T18:43:09.852565Z","submitted_at":"2024-07-08T17:08:02Z","title":"ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06135","snapshot_observed_at":"2026-08-07T06:07:24.262152Z","title":"ANOLE : An open, autoregressive, native large multimodal models for interleaved image-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.262152Z"},"links":{"cited_paper":"/paper/2407.06135","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:e2fd97ab84a8573f072e64e640d822011241f5a916cbbdb1868c3265537c23ee","observation_id":"e3caf459-b8b1-403e-a755-12a927bd2ff1","resolution":{"observed_at":"2026-08-07T06:07:24.262152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.727214Z","title":"LoRA : Low-rank adaptation of large language models","venue":null,"work_id":"59dddc39-c438-41ab-b1a3-9fc5073e349f","year":2022},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.267271Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:233a49b2133bc3dd4792a2b9b85a8852d149ec6267c4c3f7a7fdf74fe9d4f3b0","observation_id":"32172cfe-5218-4da7-9b8b-0b6637d226e4","resolution":{"observed_at":"2026-08-07T06:07:24.731994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.709033Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":"beed5bb5-e2a4-434d-b14c-0f15328e36dc","year":2020},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.272518Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:0fdef18592fee03528719f40a7c5c1f75a6578e847ed47b9db091587209b4a21","observation_id":"28e71d01-3eb4-46c8-9e6f-0f23089554fc","resolution":{"observed_at":"2026-08-07T06:07:24.715787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.277177Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.277177Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:67a2edaa4d3031ac1c5b29b5c9260cf5fe1123a0a9eceb4b18a4df01850f203f","observation_id":"24fe666c-1b17-4bb7-8922-5bf0e22de8bf","resolution":{"observed_at":"2026-08-07T06:07:24.277177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2506.06006."}