{"as_of":"2026-08-22T02:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:731dbb231fc581a60812c69ced827d0c465586ee4ad58c79b4b48d2fa8374189","coverage":[{"denominator":225,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T17:29:18.513507Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T02:52:15.372254Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01164","snapshot_observed_at":"2026-07-12T08:04:48.963890Z","title":"Towards interactive video world modeling: Frontiers, challenges, benchmarks, and future trends.arXiv preprint arXiv:2606.01164, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02642","last_updated":"2026-07-02T17:02:43Z","snapshot_observed_at":"2026-08-18T23:16:38.033385Z","submitted_at":"2026-07-02T17:02:43Z","title":"GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-12T08:04:48.963890Z"},"links":{"cited_paper":"/paper/2606.01164","citing_paper":"/paper/2607.02642"},"observation_digest":"sha256:ccea9600c73eb16c83b916d8f315d124fcc6e05de3419720ea3c77769bfdb553","observation_id":"84e0098f-5256-48c9-aaca-6d7b098efb3f","resolution":{"observed_at":"2026-07-12T08:04:48.963890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01164","snapshot_observed_at":"2026-08-02T02:52:15.372254Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14076","last_updated":"2026-07-15T17:48:48Z","snapshot_observed_at":"2026-08-12T15:43:58.148008Z","submitted_at":"2026-07-15T17:48:48Z","title":"From Pixels to States: Rethinking Interactive World Models as Game Engines","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T02:52:15.372254Z"},"links":{"cited_paper":"/paper/2606.01164","citing_paper":"/paper/2607.14076"},"observation_digest":"sha256:aab1fcef7061cb47b779e0cf50f84dc9592a3a072a19efc7e500c8b5e22ea8e6","observation_id":"529e2ac7-a649-414c-84dc-d97d0650b876","resolution":{"observed_at":"2026-08-02T02:52:15.372254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01164","snapshot_observed_at":"2026-08-01T14:02:14.937715Z","title":"Towards interactive video world modeling: Frontiers, challenges, benchmarks, and future trends.arXiv preprint arXiv:2606.01164, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18924","last_updated":"2026-07-21T10:06:55Z","snapshot_observed_at":"2026-08-13T06:17:20.102871Z","submitted_at":"2026-07-21T10:06:55Z","title":"Learning Explicit Physical Parameter Control and Benchmarking for Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T14:02:14.937715Z"},"links":{"cited_paper":"/paper/2606.01164","citing_paper":"/paper/2607.18924"},"observation_digest":"sha256:68a34efe06759c3cd5ebb448d5b0f7bcee0113f0c9f48d59514234ed5fee722c","observation_id":"566673cd-5a49-450c-b4a3-dea030cbfaec","resolution":{"observed_at":"2026-08-01T14:02:14.937715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.01164/citation-record","integrity":"/paper/2606.01164/integrity","json":"/paper/2606.01164/citation-record.json","paper":"/paper/2606.01164"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":null,"venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:5ee48ff84ea2f35484daef751f387262b683ade5729496d196402deacfb84c0d","observation_id":"9d1a4243-5f47-433f-8d0e-bf091b3896ad","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-08-18T07:04:58.690133Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":"1803.10122","doi":"10.48550/arxiv.1712.00409","metadata_source":"pith","pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Models","venue":"cs.LG","work_id":"07227eee-8445-4c98-bce4-c6a6fd5ed907","year":2018},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:6f86db82d456c4bc11a7b3f59e18bc6b02b141d4617cde98bc061db7c18efb1e","observation_id":"d10e75cd-d0c4-49e3-ab16-2900cc71a89a","resolution":{"observed_at":"2026-07-01T21:06:14.266134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"A path towards autonomous machine intelligence version 0.9. 2, 2022-06-27,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:b739225e8265b63a1ca3a9a8d30296b1397da80fce3a241864c55463575972a5","observation_id":"fdfdb6cd-5a4a-49a1-8739-8ef7b4f4285f","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"ivideogpt: Interactive videogpts are scalable world models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:c6d88c2ab61dd5aedcef55931334c1f840c55dec644f269529499a8402237de2","observation_id":"533592c5-5403-48d9-88ae-a5b8ae81a02f","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Drivedreamer: Towards real-world-drive world models for au- tonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:9a4f5e8c1f2893f7061f9f6a5a33edd1b5ec37cb273885ef9ab6716783c37285","observation_id":"65e0fbc2-01a7-4a00-9ed6-f5d086d73503","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16732","last_updated":"2026-06-25T19:54:02Z","snapshot_observed_at":"2026-08-19T23:45:04.716820Z","submitted_at":"2025-10-19T07:12:32Z","title":"A Comprehensive Survey on World Models for Embodied AI","version":3},"cited_work":{"arxiv_id":"2510.16732","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.16732","snapshot_observed_at":"2026-07-04T17:29:59.537323Z","title":"A comprehensive survey on world models for embodied ai","venue":"cs.CV","work_id":"d4ba9e8d-69e0-462a-b353-627172c1e415","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2510.16732","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:3a7201de09c3b82cbe17a50f62ca5e4a16558ec29872f250cc9c6a68f4501d8c","observation_id":"05be8463-b390-48db-8f07-5b9580b9bd86","resolution":{"observed_at":"2026-07-01T21:06:14.291326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Unrealzoo: Enriching photo-realistic virtual worlds for embod- ied ai,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:63ebbbd90649a10634b88bd187a63f0f67c1f48f077cc20c4f3b41d07b456ccc","observation_id":"d0c55213-bd93-403a-b773-a679b86b3f2d","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Navigation world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:72c1039dbec742a34b8632fc9bd82df34fd8e1a647d1f14785428bf52b04db7d","observation_id":"a258903e-d607-4e09-9449-8d6793d2453d","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08168","last_updated":"2026-04-09T12:28:14Z","snapshot_observed_at":"2026-08-18T13:46:02.865692Z","submitted_at":"2026-04-09T12:28:14Z","title":"ViVa: A Video-Generative Value Model for Robot Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2604.08168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08168","snapshot_observed_at":"2026-07-04T17:40:00.354847Z","title":"ViVa: A Video-Generative Value Model for Robot Reinforcement Learning","venue":"cs.RO","work_id":"eec5968f-9677-493b-a20c-596437c64b3d","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2604.08168","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:8192e8e106d3d6af9c3b5a697528a535f179fac08ac894140e286ae925d57de0","observation_id":"9f70c3ba-17e7-4ad7-8354-04cf2e89e7b4","resolution":{"observed_at":"2026-07-01T21:06:14.300781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18701","last_updated":"2025-06-23T14:40:49Z","snapshot_observed_at":"2026-08-13T01:07:40.530562Z","submitted_at":"2025-06-23T14:40:49Z","title":"Matrix-Game: Interactive World Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.18701","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18701","snapshot_observed_at":"2026-07-03T20:28:55.393899Z","title":"Matrix-game: Interactive world foundation model","venue":null,"work_id":"ee5b0cc3-a913-4815-8943-74c18daf05ed","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2506.18701","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:c832309555fab06fc51e2936c30e842c121888b4a1062bfbc96c456360265af3","observation_id":"3108524f-df53-4132-8751-6d6a1611ccff","resolution":{"observed_at":"2026-07-01T21:06:14.314975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13009","last_updated":"2026-04-07T11:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T15:28:53Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","version":4},"cited_work":{"arxiv_id":"2508.13009","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.13009","snapshot_observed_at":"2026-07-09T07:56:04.730683Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","venue":"cs.CV","work_id":"492a2d34-e672-45fb-8f54-c720d2dfae5a","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2508.13009","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:8c329e501f9fa1242d78ceff2014f53c4fbead50ad187be07a05701bfdb01f49","observation_id":"b9c3aa60-bcce-46c6-9eee-34d7948e5a5c","resolution":{"observed_at":"2026-07-01T21:06:13.857957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Gamefac- tory: Creating new games with generative interactive videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:86613339b85cdef54fee289b7f679d5ae8995231926e2d725f1af52770e95087","observation_id":"994ea9bf-4dbc-426f-ae75-2186b997fcee","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Building machines that learn and think like people,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:56da0e88edd2b962889ee222038a55cb3970430c0c39e05469d7f1f54f931532","observation_id":"5a118054-e995-4332-ae27-030a17073fbe","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Genie: Generative interactive environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:661e1820b2e0a885fbe2009556c20b2f5028d2423c09e72fd0a755d76c0d5452","observation_id":"38e30e7f-5df1-4bea-9983-2439c3d46c38","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Genie 2: A large-scale foundation world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:b7b7313f42a239e2c1b73a30d2daabe87ad1f721e0a546417857cd848d764af8","observation_id":"90e789da-4b22-4c99-8ae1-0e388e9aca44","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Genie 3: A new frontier for world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:5d11492f39422a4873cd68e2626a8631f90a6e3b527113a6cf04d09fc7a89774","observation_id":"fa70e70f-b28a-41a5-80b3-b27c62dfdcee","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T22:17:26.083321Z","title":"Worldgen: From text to traversable and interactive 3d worlds","venue":null,"work_id":"2a59cb5f-f636-4b11-8185-4c1fa85c7bc6","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:e9b199afc6fe85745726ede5dc5744ee487f9fb9630a7fc0ae4153992a6de1c9","observation_id":"679cad29-0c6c-4e75-855b-723f1d94a9e5","resolution":{"observed_at":"2026-07-01T21:06:14.229929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13036","last_updated":"2026-04-14T17:59:44Z","snapshot_observed_at":"2026-08-11T10:46:08.311397Z","submitted_at":"2026-04-14T17:59:44Z","title":"Lyra 2.0: Explorable Generative 3D Worlds","version":1},"cited_work":{"arxiv_id":"2604.13036","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13036","snapshot_observed_at":"2026-07-08T10:54:49.214090Z","title":"Lyra 2.0: Explorable Generative 3D Worlds","venue":"cs.CV","work_id":"8184ff2a-3261-41e0-8c72-3a5939825175","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2604.13036","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:dd927484a68d3bc1a77dfccd653a5c628cbe38a15a3f0c2f3099c6b8a392d9b7","observation_id":"041c1407-e959-4b0a-a4b5-18b984a5b769","resolution":{"observed_at":"2026-07-01T21:06:14.288725Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Pixelverse-r1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:933e059b4152a942f4ee9d6094362d39c7609f6f8d48ce63103b91f667f8e2e9","observation_id":"2efced85-fd7c-4a76-8c49-af095f3d2309","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Happy oyster","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:17482a28db279e5f8df62a2cf0306a6e743e7c778128d1034d4ca523a3a976b8","observation_id":"ccdb2646-6087-4312-8968-15e7e6863cf7","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Available: https://runwayml.com/ research/introducing-runway-gwm-1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:847b77176a95ff4190513acfe319b053fabf88420cfef79d3a3b63e217578a6e","observation_id":"d57732db-1bdb-457a-9864-674160c3d8a3","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Wonderjourney: Going from anywhere to everywhere,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:be8a15d032a5e1311e1c422fc56c328a1dd2dd5591ecdf968a45e08d4f612b34","observation_id":"459322dc-605c-4f42-a300-918a49d67fc5","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Wonderworld: Interactive 3d scene generation from a single image,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:747383d7ca025daaec464c0b4509c4a5ed3b7a5686ff4c49a42e61316bc64cdc","observation_id":"b8d8fecd-f00d-453e-b85b-85dc86b5acc6","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.09164","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:06:14.245817Z","title":"Wonderzoom: Multi-scale 3d world generation,","venue":null,"work_id":"6301e766-46ea-4c3a-a2b0-402ecf1c4ee6","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:999d1f2064017bef124bd8a56d4a502ce8410c70548c30be9ea5c5319a88491e","observation_id":"7de90088-907a-47ed-bc84-22a8aebb4152","resolution":{"observed_at":"2026-07-01T21:06:14.247177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-13T17:45:09.123419Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"cited_work":{"arxiv_id":"2601.20540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.20540","snapshot_observed_at":"2026-07-10T08:36:59.816756Z","title":"Advancing Open-source World Models","venue":"cs.CV","work_id":"3446760e-6460-429e-82f6-6a5133ce4c8a","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2601.20540","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:14062c545e8208bffd15b2f289967859ebdeb2671bccbb9cb6c974bfae4b0a19","observation_id":"6f1f6812-bf9f-41e0-a819-55865abcbec4","resolution":{"observed_at":"2026-07-01T21:06:14.216561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Matrix-game 3.0 real-time and streaming interactive world model with long-horizon memory,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:bf22bfb4debf170ee17dc2366b92defd18d35df758101889eac5e33c73556339","observation_id":"f8498eb2-cdbb-48bd-851f-258ff6ae99eb","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17744","last_updated":"2025-07-23T17:57:09Z","snapshot_observed_at":"2026-08-18T01:15:50.607208Z","submitted_at":"2025-07-23T17:57:09Z","title":"Yume: An Interactive World Generation Model","version":1},"cited_work":{"arxiv_id":"2507.17744","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.17744","snapshot_observed_at":"2026-07-08T10:54:49.210345Z","title":"Yume: An interactive world generation model","venue":"cs.CV","work_id":"15c931d5-49da-401c-8c91-5b0de83195de","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2507.17744","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:66569ffbb7200d99f9c3c3e60463751e67dc159d792d23956c253cf4ec19d1f5","observation_id":"b7640ef9-79e3-4d39-b80c-b130ba673cb8","resolution":{"observed_at":"2026-07-01T21:06:13.996526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.22096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.240397Z","title":"Yume-1.5: A text-controlled interactive world generation model.arXiv preprint arXiv:2512.22096","venue":null,"work_id":"ad52c05d-d5a2-4898-a706-6e9f58dd3cf3","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:94d07190b4491a7d67d94bbcf7d373173ccfbe2513bd3dff36c622aaceb90f9a","observation_id":"9c2b18a6-7b4f-494b-af4f-139c85d3f2e5","resolution":{"observed_at":"2026-07-01T21:06:14.219291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-14T16:23:20.854858Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":2},"cited_work":{"arxiv_id":"2512.14614","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.14614","snapshot_observed_at":"2026-07-09T07:56:04.709254Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","venue":"cs.CV","work_id":"48231e12-6c15-4f28-8c51-092766c59f93","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2512.14614","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:f765267be25dca66b70dbe75e52780cf3c95b8e0e8fba2b7b213bb9608954cf7","observation_id":"662ca90b-6573-4015-9d1d-d867576f3599","resolution":{"observed_at":"2026-07-01T21:06:14.208337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Vmem: Consistent inter- active video scene generation with surfel-indexed view memory,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:7d8607c767011fb90fdce38389a0b8c7ba8ed70b706c0c4468692b64ef2cf3af","observation_id":"092502a0-59e1-4903-a310-22c0665fa799","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:56:04.679179Z","title":"Solaris: Building a multiplayer video world model in minecraft","venue":null,"work_id":"5267e6c2-fd8e-4a6d-8cf5-15dbba54639d","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:31160b4a812ba291ba0651e679744ee3d7335283dcab5ea9333f66edf2ff483a","observation_id":"c83932df-1027-4873-ae9a-764b6f31a467","resolution":{"observed_at":"2026-07-01T21:06:14.233184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.05449","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:47:41.355845Z","title":"Realwonder: Real-time physical action-conditioned video generation.arXiv preprint arXiv:2603.05449","venue":null,"work_id":"817e39ca-1acb-4170-b2c5-6d47674dfa6c","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:fabffb42d31fd38feff29271d18cf0d76d88ce1b44f016a003e5d4bcbcc2d078","observation_id":"c051683f-e79a-46e0-b499-443cecd73562","resolution":{"observed_at":"2026-07-01T21:06:14.235904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Available: https:// danwilliamsphilosophy.com/2018/09/07/ chapter-3-kenneth-craiks-hypothesis-on-the-nature-of-thought/","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:b9f297a5dcf362c7403dba54daf6500af10d510860b904b2dcec905737724f24","observation_id":"e9bb40bf-7b3a-4aaa-a9c9-84b2a82e1491","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12672","last_updated":"2023-06-23T06:05:31Z","snapshot_observed_at":"2026-08-16T22:06:59.789757Z","submitted_at":"2023-06-22T05:14:00Z","title":"From Word Models to World Models: Translating from Natural Language to the Probabilistic Language of Thought","version":2},"cited_work":{"arxiv_id":"2306.12672","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.12672","snapshot_observed_at":"2026-07-02T08:16:47.564365Z","title":"K.; Goodman, N","venue":null,"work_id":"6c5737b4-17c2-4f98-8bee-b388145aef7b","year":2023},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2306.12672","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:24f30880cee8c57a63d95f226b6a4f9890b8e3c65075905cb3f5e62ea5124481","observation_id":"9f6fb005-387c-45ab-bea7-a3d1b6d65674","resolution":{"observed_at":"2026-07-01T21:06:14.306576Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.00393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:50:11.212321Z","title":"NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos, January 2026","venue":null,"work_id":"1715e14a-e944-439f-bb45-3586b54a9cf2","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:daabe55e14057a091e909a40ffcd03d3d93e7449b30765cc0b10b3795ca39ef8","observation_id":"b4906164-2c26-4fe0-be6d-d1a08975bcf3","resolution":{"observed_at":"2026-07-01T21:06:14.261008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:1110a0af2141058dd73576393cf82f12d410739066d6bdf32105fbb98e6e9745","observation_id":"8d7cf571-127f-4217-8f76-a96854309d50","resolution":{"observed_at":"2026-07-01T21:06:14.255738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Available: https://marble.worldlabs.ai/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:dc54b9a30685ec091dc52c92184f4c5c8e9dc241a3df39db62a9dc16d8c53354","observation_id":"685f08c0-c571-451a-a9ad-bb1a94e8aa81","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Physgen3d: Crafting a miniature interactive world from a single image,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:8036b9a7f6c7166889c67e715d0762c948bc01e09cb351c4b3dc4764f4221d2b","observation_id":"ca5ac007-f3a7-4eda-8713-bc8c88cf1ebf","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.11061","last_updated":"2026-06-19T17:55:57Z","snapshot_observed_at":"2026-08-17T15:27:08.280650Z","submitted_at":"2025-12-11T19:21:47Z","title":"VDAWorld: World Modelling via VLM-Directed Abstraction and Simulation","version":2},"cited_work":{"arxiv_id":"2512.11061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.11061","snapshot_observed_at":"2026-07-01T22:46:19.365963Z","title":"VDAWorld: World Modelling via VLM-Directed Abstraction and Simulation","venue":"cs.CV","work_id":"64813b96-d939-49eb-8f84-1ab81f36ab6a","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2512.11061","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:c583bf9ddde5a90a69bf9677fb72124e8734b21af03d4835a664a437e854066b","observation_id":"8127d1f9-0387-42e9-a007-a446b8e9d18d","resolution":{"observed_at":"2026-07-01T21:06:14.271557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":"2209.14792","doi":"10.48550/arxiv.2209.14792","metadata_source":"pith","pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","venue":"cs.CV","work_id":"52a801fc-a707-45a1-a8cd-0d6702f124ab","year":2022},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:d045db2c1de1e5197f3cc27381f97798100c39a13eda86f958876e2d6996e17f","observation_id":"6476da50-3484-4b32-ba6c-1f1d53722631","resolution":{"observed_at":"2026-07-01T21:06:14.293959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Learning interactive real-world simulators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:fb29f673d40c4a37edaab6d05b0a097eac8230318c32f8acba897a5530e33067","observation_id":"8c1e304b-ddfc-46b0-ac6d-c2c77bf9fdda","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Adding conditional control to text-to-image diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:f4b5bd3806805358242d37f4a2fea9d232ec93196b0f2654a669f61a067b4eeb","observation_id":"a0543213-50d2-4019-9b21-915a12d5f6b7","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.18886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:49:30.952607Z","title":"Magicworld: Interactive geometry-driven video world exploration","venue":null,"work_id":"86055d66-d6bd-4b8c-b9d0-b5191864cfe4","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:7fb45b8a65fb8eb96afcf0a2752d67ab1b8ba95c88a131b6d5e196812504a650","observation_id":"cc53e715-df95-44af-8569-4f2e70c6f1ce","resolution":{"observed_at":"2026-07-01T21:06:14.227286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.09022","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:06:13.889572Z","title":"WorldCompass: Reinforcement learning for long-horizon world models","venue":null,"work_id":"ee41c519-2249-4964-9243-0675117f6d61","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:b7809c0cfba9612d1340af239184b8599bb5ee536709a92be8432f3b6376ed80","observation_id":"29861149-80dd-4f91-9c39-8f27f046babe","resolution":{"observed_at":"2026-07-01T21:06:13.891322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-08-14T13:55:25.823113Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2508.05635","doi":"10.48550/arxiv.2508.05635","metadata_source":"pith","pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","venue":"cs.RO","work_id":"440ad435-44ba-4acd-9aeb-21dd3ee04835","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:907ff27fa07f58770dd3bdc9b34dcaf04efe2e00004f45088dce7565505fc6d9","observation_id":"a03711f1-48af-4dfa-8b77-2f7ccdd3ff84","resolution":{"observed_at":"2026-07-01T21:06:14.311686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.201717Z","title":"The world is your canvas: Painting promptable events with reference images, trajectories, and text","venue":null,"work_id":"83b5e9d3-6be6-403a-9f4d-bfac95139983","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:a444d67f805a1aabc8b8a83534e363fa61fb85ea1b697d1f16c248dc9f9f3b14","observation_id":"b1dc32a1-8545-4155-9d67-b3e9bead6add","resolution":{"observed_at":"2026-07-01T21:06:14.296777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:ae770c44eed8b8f64a8b47a5d7ad534e72a15d01368b1520f560b39562d6f30c","observation_id":"02dbeb3e-0bdb-4f96-a4a7-1fe21b984019","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04876","last_updated":"2026-05-20T07:57:24Z","snapshot_observed_at":"2026-08-16T19:15:31.392809Z","submitted_at":"2026-02-04T18:58:55Z","title":"PerpetualWonder: Long-Horizon Action-Conditioned 4D Scene Generation","version":2},"cited_work":{"arxiv_id":"2602.04876","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04876","snapshot_observed_at":"2026-07-04T15:49:57.976835Z","title":"PerpetualWonder: Long-Horizon Action-Conditioned 4D Scene Generation","venue":"cs.CV","work_id":"8a0e8bee-29cb-4915-bb49-ba3c6864210e","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2602.04876","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:fcc1174ab9a95df611f1d7ba6c556c887844ba3b8c29756b1a2f9713447c95ec","observation_id":"7b3da35f-1994-40df-aa1c-74e2c098a23e","resolution":{"observed_at":"2026-07-01T21:06:13.900562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08546","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.586020Z","title":"Interactive world simulator for robot policy training and evaluation","venue":null,"work_id":"8a2a3980-472f-4433-ac4a-ebdc041ba8e8","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:65522b88b3799c9129c37ff78f6612a8eee6b2686b821f2ce500cb8868a160bd","observation_id":"f9c744ae-15b5-4968-a2f4-4b12d4f3546a","resolution":{"observed_at":"2026-07-01T21:06:13.860545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Vid2world: Crafting video diffusion models to interactive world models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:8a5124e039f7c258af055530f0bd95576b3dda5fccc07f99f78ce74345e42345","observation_id":"56bd0eb8-ec93-45ab-86c7-e33efb17b21c","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:4fefaf84bfe9e95f2d06a07255a93d2d370bd0c8ad3ad88ee6d5f4f37ebd4985","observation_id":"2b00aeb5-752d-4098-af50-b224890fe78b","resolution":{"observed_at":"2026-07-01T21:06:13.881323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Generative adver- sarial nets,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:68a108d3192a0788f0cd88fe7ade0c8a6d9d3e9c73453fa7b69ee6b10e48a884","observation_id":"f165f40b-acf7-4bd3-8372-3f555e589560","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Learn- ing to simulate dynamic environments with gamegan,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:c38c4147523fe77fbdb600cab0b223865f51b9d65839bfba43c069071768b81b","observation_id":"462c170b-61bb-41b9-9351-16f39f592cb0","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Deep unsupervised learning using nonequilibrium thermody- namics,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:9d41dcd578167eecac99a2470a1b9ba8041209ab4c3fbe8401fa201c5184e377","observation_id":"ad40aaaa-cca4-4680-9616-6a1df8e77ff3","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:f7949a604a007a23d337ad7b947353efdf9d43096dd2dfff7872fa0343645385","observation_id":"ff0fd887-cb9e-45c1-be65-45d299986960","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00769","last_updated":"2024-12-06T13:09:43Z","snapshot_observed_at":"2026-08-20T19:25:04.045579Z","submitted_at":"2024-11-01T17:59:17Z","title":"GameGen-X: Interactive Open-world Game Video Generation","version":3},"cited_work":{"arxiv_id":"2411.00769","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00769","snapshot_observed_at":"2026-07-03T01:07:30.588949Z","title":"Gamegen-x: Interactive open-world game video generation","venue":null,"work_id":"5f3b923c-3fdc-468a-8951-94c4ff7b1e29","year":2024},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2411.00769","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:0dda4992d038591af60b56912d2dbf4e0fbfb0beff2c375cdb736ac53488f16d","observation_id":"f7699c02-f203-445f-8160-f8a4947872ba","resolution":{"observed_at":"2026-07-01T21:06:14.238939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Worldmem: Long-term consistent world simulation with memory,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:8701bbc45c1d19003acbbc5c87ebde31f79a61d4778e561aa07dbcc26e9ef8d4","observation_id":"9f2600bb-9b66-4b98-aa40-abbe91fdbb0a","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Fantasyworld: Geometry-consistent world modeling via unified video and 3d prediction,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:6a502f06e05702fc53d070a6d791ac3418f3ba60b24422e1f3a0d4d57916ffd7","observation_id":"ff39631f-46bf-4d0a-a212-08bc0324b757","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03747","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T14:17:02.584894Z","title":"Live: Long-horizon interactive video world modeling","venue":null,"work_id":"663a2f6f-70f9-423c-afb1-d9c69be99914","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:a51d95d93dd613ab50f66a6c086673417f4615384d1e0c4603822f98b14acb95","observation_id":"8d1af072-39be-4d51-916a-829b23c0ea9c","resolution":{"observed_at":"2026-07-01T21:06:13.882530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-15T19:36:40.797672Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"cited_work":{"arxiv_id":"2602.10104","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.10104","snapshot_observed_at":"2026-07-04T06:29:37.344466Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","venue":"cs.CV","work_id":"dcacc723-b8e0-4705-9c61-5ae898b7310e","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2602.10104","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:1b7164fe9d8432df53af9a4c9b95043c9a1f8008ccf6aad90e98ff1e1f76ba9b","observation_id":"03467068-3f90-41c2-aff6-98c5a151d989","resolution":{"observed_at":"2026-07-01T21:06:13.800395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.16871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:08:55.922104Z","title":"Worldcam: Interactive autoregressive 3d gaming worlds with camera pose as a unifying geometric representation","venue":null,"work_id":"b0c261ec-8f68-4e85-8ec4-c06fb7e0a0f5","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:67e1f290f5deb2ff73376284e092ea9714d0f6f8caae4c48268ec445057c8b4a","observation_id":"e1d58ce7-899f-4cd4-bc9e-997728a84ee9","resolution":{"observed_at":"2026-07-01T21:06:13.878798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Scalable diffusion models with transform- ers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:d57ffbfad486225f39183040d8a07645608966b1cdb9a5a6dbee5898a5644e6c","observation_id":"e569575a-d711-4af0-bcba-211edf3a07ab","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08388","last_updated":"2025-04-11T09:41:04Z","snapshot_observed_at":"2026-08-21T01:54:04.612288Z","submitted_at":"2025-04-11T09:41:04Z","title":"MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft","version":1},"cited_work":{"arxiv_id":"2504.08388","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.08388","snapshot_observed_at":"2026-07-08T10:54:49.297399Z","title":"Mineworld: a real-time and open-source interactive world model on minecraft","venue":"cs.CV","work_id":"51784a48-c98d-430f-92ec-ffa426c300b3","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2504.08388","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:04d50b5a75799a9f78ce3c9b24c854ba6e00337eb961ad0472a8f23ebe028b1a","observation_id":"68cd0ee6-1aab-464e-b556-73279a5268b0","resolution":{"observed_at":"2026-07-01T21:06:13.883975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Video2game: Real- time interactive realistic and browser-compatible environment from a single video,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:582f47186257ed72c637cbcd3b828c16494fbcde8b76195e6f73e16fe1c73f03","observation_id":"e62e15a2-e643-410f-861c-8daf62144fdd","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Diffusion for world modeling: Visual details matter in atari,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:a1b60c2feef9ea087e21abefb058e30dfab530d21ff9a55137f449470a8abe03","observation_id":"53a213b2-4bcc-4df9-8f5b-6ce4f161c277","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Oasis: A universe in a transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:0c169f3df28c583367161f44f34a81cf2e2b45bc7d28b5bfd40093993c59ebd2","observation_id":"cc2c9c31-4f8c-43de-99fe-f60989072a54","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Diffusion models are real-time game engines,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:ec67b393d0cd539ba40cc23a74dde860e06f202482fe08737e48a6632645702b","observation_id":"7dc00f1d-4dda-49ae-ae6e-c2b76cb21e44","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Adaworld: Learning adaptable world models with latent actions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:74b17240fdd19a231f818c7f5195001ec9ff02b8252b33787f4441febbf4f794","observation_id":"28a581b8-8bf8-460e-8a8c-e04e87b480a9","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Wonderturbo: Generating interactive 3d world in 0.72 seconds,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:3df46bf592312a0c54ce7a157e5094d89a82913283c0bcfd8a388e7eeea2f4e6","observation_id":"10dd9104-ccff-48ec-b86f-c90222f9e5bf","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Long-context state-space video world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:6a5533247be9331efde1ff3c5e188ac57957a38b2943da2e64a70c8ca9e7b3df","observation_id":"13dd4293-2dc4-4468-9d69-aacd333a7b1c","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Aether: Geometric-aware unified world modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:25a51fc583bc3222eeec2efe87c806ff5f4a502ea74796e797a64e3152832f93","observation_id":"2d12b62b-f341-4df5-82fc-8381d767d62a","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Video world models with long-term spatial memory,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:12c818f419c9ecb86076b5abe83a48edc3af9910bf771af3687fd861993f5a65","observation_id":"5edfec31-76b3-4f50-aa5b-d1a690a461db","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Image as a world: Gener- ating interactive world from single image via panoramic video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:4177f382b6edc94c285ae770eb2e9bc19a6f191d4bbce149885c3b22f6d5e77c","observation_id":"71f7d87a-8e63-4876-a0ed-deacadfd56c0","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"The matrix: Infinite-horizon world generation with real-time moving control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:e0807cd7720d1e4b8d72bda493a064578cff5f3fcac9dd02ec5e9cc489d267fa","observation_id":"7e962bad-f063-4b7f-9b32-026c93a8ee1f","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01103","last_updated":"2025-06-01T17:58:36Z","snapshot_observed_at":"2026-08-21T03:38:06.849314Z","submitted_at":"2025-06-01T17:58:36Z","title":"DeepVerse: 4D Autoregressive Video Generation as a World Model","version":1},"cited_work":{"arxiv_id":"2506.01103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01103","snapshot_observed_at":"2026-07-03T00:57:30.505107Z","title":"Deepverse: 4d autoregressive video generation as a world model","venue":null,"work_id":"a5aaa78b-144b-44a1-a69f-12709eb9a483","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2506.01103","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:cfdf57454d5e08d60ebf6e561c4c76ced0e3a826fe82db304c6082ef70212f4d","observation_id":"c49ae5aa-b377-48f7-919d-992ae2b7a068","resolution":{"observed_at":"2026-07-01T21:06:13.889407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10600","last_updated":"2025-06-16T08:50:31Z","snapshot_observed_at":"2026-08-19T23:22:05.931699Z","submitted_at":"2025-06-12T11:43:50Z","title":"EmbodiedGen: Towards a Generative 3D World Engine for Embodied Intelligence","version":2},"cited_work":{"arxiv_id":"2506.10600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10600","snapshot_observed_at":"2026-07-04T10:49:46.451842Z","title":"Embodiedgen: Towards a generative 3d world engine for embodied intelligence","venue":null,"work_id":"60a29e77-ced1-486a-a32b-607339c75448","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2506.10600","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:5d51d714426ae6294c20a13a08c81f40c3f93bbd62d05aa1ae3ba2b41208315e","observation_id":"b3ab9e4b-e441-4a91-8f95-a76b3c7aed29","resolution":{"observed_at":"2026-07-01T21:06:13.903667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Hunyuan-gamecraft: High-dynamic interactive game video generation with hybrid history condition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:baacef52cfcdb57a7d9907a216938d8137d5dedca1db7262e39e6d90a937bb15","observation_id":"8178f15a-4e37-43d2-a71c-7e363845015f","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21809","last_updated":"2025-08-13T09:21:11Z","snapshot_observed_at":"2026-08-19T23:36:33.407202Z","submitted_at":"2025-07-29T13:43:35Z","title":"HunyuanWorld 1.0: Generating Immersive, Explorable, and Interactive 3D Worlds from Words or Pixels","version":2},"cited_work":{"arxiv_id":"2507.21809","doi":"10.48550/arxiv.2507.21809","metadata_source":"pith","pith_arxiv_id":"2507.21809","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuanworld 1.0: Generating immersive, explorable, and interactive 3d worlds from words or pixels","venue":"cs.CV","work_id":"c6acc052-25de-49cf-90fc-d23468f99e8d","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2507.21809","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:3ba159f45187b7402a54123633148c39535ac63e15f5024dac17d728ad654c49","observation_id":"6ef63e82-5a34-4cf5-b72c-cf66eb81cb0f","resolution":{"observed_at":"2026-07-01T21:06:14.165974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:51.924462+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:51.924462+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08086","last_updated":"2025-08-11T15:29:57Z","snapshot_observed_at":"2026-08-10T14:26:28.305874Z","submitted_at":"2025-08-11T15:29:57Z","title":"Matrix-3D: Omnidirectional Explorable 3D World Generation","version":1},"cited_work":{"arxiv_id":"2508.08086","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08086","snapshot_observed_at":"2026-07-03T13:58:21.933849Z","title":"Matrix-3d: Omnidirectional explorable 3d world generation","venue":null,"work_id":"f2f1c6be-1f33-457e-8988-c58f40d11ff9","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2508.08086","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:d021aa3e11716fc3beb4ddcf4e13412e72eed5503318dfda40e5c7a7bd606478","observation_id":"69d0c72e-fd34-45e2-89f0-965b42473cd7","resolution":{"observed_at":"2026-07-01T21:06:14.104813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24527","last_updated":"2025-09-29T09:42:27Z","snapshot_observed_at":"2026-08-13T03:00:49.988137Z","submitted_at":"2025-09-29T09:42:27Z","title":"Training Agents Inside of Scalable World Models","version":1},"cited_work":{"arxiv_id":"2509.24527","doi":"10.48550/arxiv.2509.24527","metadata_source":"pith","pith_arxiv_id":"2509.24527","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Agents Inside of Scalable World Models","venue":"cs.AI","work_id":"f0464a07-aaee-486f-a0b1-a4bce0bbc3e4","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2509.24527","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:99443a8e2de02a3fb1449ae55ac3ecbf1729a3c3c0e67d3fc9d70280e0da2777","observation_id":"f3d46479-10b6-4ee6-8771-eda3277d8b61","resolution":{"observed_at":"2026-07-01T21:06:14.178403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.03198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:47:41.299641Z","title":"Mem- ory forcing: Spatio-temporal memory for consistent scene generation on minecraft","venue":null,"work_id":"9d614233-f030-4526-bac0-e91d5c9ab88c","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:eb29f0e15d49394e2edd3fc4bbe83678913f70c54b95f99b30fe4f26ecd92b8b","observation_id":"c4089b7c-41cc-4faa-be8a-60bd771d2c3f","resolution":{"observed_at":"2026-07-01T21:06:13.946198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.09057","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.252836Z","title":"Pan: Aworldmodelforgeneral,interactable,andlong-horizonworldsimulation","venue":null,"work_id":"9df4502a-4028-43c9-9b40-8fea39effac4","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:2b8ab3e109c464cac51dbc6f8d22e3e900d7632a95810c7f30a9f9148bf43ce9","observation_id":"31c77891-9da9-406e-88d3-4d401f88956d","resolution":{"observed_at":"2026-07-01T21:06:13.903174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04040","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:07.566418Z","title":"Relic: Interactive video world model with long-horizon memory.arXiv preprint arXiv:2512.04040","venue":null,"work_id":"d398db79-a718-4fff-a215-641fd1af997a","year":2025},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:17e7b4e2339e60bf1ab6137ba2e941066d18afc7a37ebc6efd2b62d2b99a5328","observation_id":"c8dfcffc-01c7-4a9d-8564-512312081d06","resolution":{"observed_at":"2026-07-01T21:06:14.169889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.00051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T12:08:06.368191Z","title":"Infinite-canvas: Higher-resolution video outpainting with extensive content generation","venue":null,"work_id":"7f26d806-78f1-45cd-b320-4e3c0018466a","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:ee63cd93adbd2f091e2b32d71c516c84b705432de26ce7db36ea14c5b26d075c","observation_id":"8d52bddd-8ab5-4176-801c-6ec852068140","resolution":{"observed_at":"2026-07-01T21:06:14.172723Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Astra: General interactive world model with autore- gressive denoising,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:9e70aa97ce199eca981771b0ffbba071bc28894e53023f6e18978978158c1adb","observation_id":"67c61389-5e93-4654-b5e0-582eff9b0e46","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Motionstream: Real-time video generation with in- teractive motion controls,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:8fc1e6790b18ea3eff2b16678b9e2d240fec096696c1399227c608baaf502045","observation_id":"1fc31e3a-68b2-4d30-b103-a02882947154","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05138","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:56:20.251012Z","title":"billboard","venue":null,"work_id":"5143a3b9-b642-4885-9fd0-d07838b8a20f","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:f1eb8bec25e8b156a9c790b88469ca9aa78b01d226ec5c3817e591eeb27ab7b5","observation_id":"67f3c996-c492-4864-ac96-c47689c5b172","resolution":{"observed_at":"2026-07-01T21:06:13.911872Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.28757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:06:13.851653Z","title":"Sonoworld: From one im- age to a 3d audio-visual scene,","venue":null,"work_id":"7cf08d22-8063-4640-aa5a-85be9eb8d0ce","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:dc4e8e2978a4500a967f014df2473f5c45bd910647c91e83416711cc9173db3d","observation_id":"32d59474-c10e-4637-8f9a-6e763fb0438f","resolution":{"observed_at":"2026-07-01T21:06:13.853098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.30045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T22:49:00.879853Z","title":"Omniroam: World wandering via long- horizon panoramic video generation","venue":null,"work_id":"f841ed17-a6a6-432b-9001-e47efce96dda","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:c69a2836ba54ca7ec1b131a29d19075d5dee240a26d17f3b42de92ad75ad49f5","observation_id":"114ad9a7-9bce-41a5-a078-03b8c21f7fa7","resolution":{"observed_at":"2026-07-01T21:06:13.850489Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T10:54:49.220855Z","title":"Infinite-World: Scaling interactive world models to 1000-frame horizons via pose-free hierarchical memory","venue":null,"work_id":"c6bda419-e0dc-45aa-b96b-eef3a31d0930","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:4f0eb94a229d92a479a5d55b40714a0b5f2fc74c48e346d495c67b133a0bbccf","observation_id":"3de8c5fe-2d39-46ad-a1e4-18571641b133","resolution":{"observed_at":"2026-07-01T21:06:13.855781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:29:18.513507Z","title":"Spheri- calDreamer: Generating Navigable Immersive 3D Worlds with Panorama Fusion,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:e42c1e0beaec7aaa1928b383876c892af0478c76752110ab369a8cd458e02c20","observation_id":"8068155b-ed2f-41f0-8298-8714895e7d06","resolution":{"observed_at":"2026-06-28T17:29:18.513507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15284","last_updated":"2026-07-29T04:41:17Z","snapshot_observed_at":"2026-08-21T02:25:02.126058Z","submitted_at":"2026-01-21T18:59:32Z","title":"Walk through Paintings: Egocentric World Models from Internet Priors","version":2},"cited_work":{"arxiv_id":"2601.15284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15284","snapshot_observed_at":"2026-07-30T02:04:31.419200Z","title":"Walk through paintings: Ego-centric world models from internet priors","venue":null,"work_id":"31087833-67c9-44b5-bfbb-0186ca084522","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2601.15284","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:28df828dfac88dedc8fbb7d898b5d8a20fb49996b99f4423665fea0d10304aa4","observation_id":"fa9e3d5c-4b5c-4a04-adf8-59ea64372cb6","resolution":{"observed_at":"2026-07-30T02:04:31.419200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.15281","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:16:17.115464Z","title":"StableWorld: Towards stable and consistent long interactive video generation","venue":null,"work_id":"ab2c77ce-372c-4a53-9607-aa228d0637eb","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:e14e73aa6319488ab7caa4acaf9831c0f4230b761db58743e7f555c4ad33eecc","observation_id":"36daf830-9606-41cb-953b-2b7eda14f465","resolution":{"observed_at":"2026-07-01T21:06:13.836050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.03482","last_updated":"2026-06-03T14:11:45Z","snapshot_observed_at":"2026-08-18T08:40:38.476293Z","submitted_at":"2026-03-03T19:58:31Z","title":"Beyond Pixel Histories: World Models with Persistent 3D State","version":2},"cited_work":{"arxiv_id":"2603.03482","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.03482","snapshot_observed_at":"2026-07-03T00:57:29.725751Z","title":"Beyond pixel histories: World models with persistent 3d state","venue":"cs.CV","work_id":"5a236ba1-904c-496c-b481-b53287062b70","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2603.03482","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:152a52707ca783173a4524bfc5eb95cc398b7435509fa94d2768bb853a512a7a","observation_id":"85b2d6e7-33ca-4f90-850e-e34891243f35","resolution":{"observed_at":"2026-07-01T21:06:14.001883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.07145","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:49:30.995441Z","title":"LiveWorld: Simulating out-of-sight dynamics in generative video world models","venue":null,"work_id":"ca4d01be-0052-4868-83e4-661d6913044a","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:ca65faae24a1e421715f63c6eb8567e50627e9ae64b8223cbd6db0127cdb6d14","observation_id":"e85e8c15-d0d9-4410-ab8a-8f6a65792042","resolution":{"observed_at":"2026-07-01T21:06:13.914362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.15583","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T16:47:09.404703Z","title":"Grounding world simulation models in a real-world metropolis","venue":null,"work_id":"e929a4e7-b217-49c9-b19f-b3222cc81bdb","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:1bff89de0ebf96873c3832e3cf9daaa2799aef41fd6e4192275a0913909312c2","observation_id":"0c6cf398-74a2-46b1-a946-73141978215a","resolution":{"observed_at":"2026-07-01T21:06:14.250007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.17117","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:47:41.321851Z","title":"Mosaicmem: Hybrid spatial memory for controllable video world models","venue":null,"work_id":"d0b14394-1476-42ab-a944-15bbcaf30d25","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:b943a20d8f0d5fbd030dff67f58fd3927dd0b349d63881962ef0dfd875add8b1","observation_id":"0432ce29-c059-49e8-94e4-fdb72c877272","resolution":{"observed_at":"2026-07-01T21:06:13.973399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02330","last_updated":"2026-07-30T19:00:35Z","snapshot_observed_at":"2026-08-18T22:28:21.760242Z","submitted_at":"2026-04-02T17:59:58Z","title":"ActionParty: Multi-Subject Action Binding in Generative Video Games","version":2},"cited_work":{"arxiv_id":"2604.02330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2604.02330","snapshot_observed_at":"2026-08-03T01:14:53.154234Z","title":"ActionParty : Multi-subject action binding in generative video games","venue":null,"work_id":"41c4f153-cc01-4d8e-a2b7-4f6c7264a47e","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2604.02330","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:73768df22e24cadc8c6b247badaa56b77f26c303b2e91559afa56b7cb616850a","observation_id":"c5c20439-8e41-4c78-b075-fcbb3083f574","resolution":{"observed_at":"2026-08-03T01:14:53.154234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07209","last_updated":"2026-04-13T13:03:18Z","snapshot_observed_at":"2026-08-18T15:38:48.854766Z","submitted_at":"2026-04-08T15:31:22Z","title":"INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling","version":2},"cited_work":{"arxiv_id":"2604.07209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.07209","snapshot_observed_at":"2026-07-04T03:49:30.956524Z","title":"INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling","venue":"cs.CV","work_id":"daf54616-b87b-4167-ac38-a81906fd3611","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2604.07209","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:a00349747df4669a04a88430cd2a7afc71e4820135032745189a3232bbaa8c4c","observation_id":"a5f05ad7-8d7d-47d5-8e69-a7bc9172a267","resolution":{"observed_at":"2026-07-01T21:06:13.863109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14268","last_updated":"2026-04-15T17:59:17Z","snapshot_observed_at":"2026-08-12T17:33:25.813833Z","submitted_at":"2026-04-15T17:59:17Z","title":"HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds","version":1},"cited_work":{"arxiv_id":"2604.14268","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.14268","snapshot_observed_at":"2026-07-03T20:28:55.425465Z","title":"HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds","venue":"cs.CV","work_id":"320f17d0-696b-48fb-b0c3-6a5fa2919345","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2604.14268","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:f17c9e2263cca2053bff648a163666e0329759a903b4906a120ad570f975e642","observation_id":"034a1a4d-6120-4214-958c-8c0607d45fbe","resolution":{"observed_at":"2026-07-01T21:06:13.818636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":47,"verified_exact":50,"verified_fuzzy":0},"total_outbound_references":225},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 100 of 225 outbound references and 3 inbound Pith citation observations for arXiv:2606.01164."}