{"as_of":"2026-08-06T15:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5cfc0425094b125c37645b332bbd52240d622b2c729f3a66075cc2539972c952","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T05:06:11.514186Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:28:04.207053Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T15:43:53.813844Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":"2604.18564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-07-07T15:43:53.813844Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","venue":"cs.CV","work_id":"334cd115-9c3c-4a4d-80f4-35a6e6179c9a","year":2026},"citing_paper":{"arxiv_id":"2605.18431","last_updated":"2026-05-19T05:12:41Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:04:26Z","title":"Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T10:36:20.388169Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2605.18431"},"observation_digest":"sha256:aefe99e02046834f85f42531dd91eb8cb0933ab18ac0d4ee69c5e963fa84e8b9","observation_id":"fa0de6cd-d377-4f6d-a44f-2b3648ec31aa","resolution":{"observed_at":"2026-05-20T10:38:12.500240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":"2604.18564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-07-07T15:43:53.813844Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","venue":"cs.CV","work_id":"334cd115-9c3c-4a4d-80f4-35a6e6179c9a","year":2026},"citing_paper":{"arxiv_id":"2605.22882","last_updated":"2026-08-03T23:32:29Z","snapshot_observed_at":"2026-08-06T14:27:32.963520Z","submitted_at":"2026-05-20T21:36:44Z","title":"GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-25T05:34:03.684055Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2605.22882"},"observation_digest":"sha256:a875c0cd1d27b9c0227a833cef3a369ba99ec4913b4a3379253f114378dee28f","observation_id":"26db756d-b7f6-4ff2-a8e5-032d852ae827","resolution":{"observed_at":"2026-05-25T05:36:39.697355Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":"2604.18564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-07-07T15:43:53.813844Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","venue":"cs.CV","work_id":"334cd115-9c3c-4a4d-80f4-35a6e6179c9a","year":2026},"citing_paper":{"arxiv_id":"2605.22882","last_updated":"2026-08-03T23:32:29Z","snapshot_observed_at":"2026-08-06T14:27:32.963520Z","submitted_at":"2026-05-20T21:36:44Z","title":"GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T16:45:15.955954Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2605.22882"},"observation_digest":"sha256:c000c2aaec63aea9776a85f26d0eb33523eb99703cdce205b256f1498227e4be","observation_id":"715fc3ed-a23b-45b1-922b-2d8f97b7a98b","resolution":{"observed_at":"2026-06-30T16:54:59.269368Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":"2604.18564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-07-07T15:43:53.813844Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","venue":"cs.CV","work_id":"334cd115-9c3c-4a4d-80f4-35a6e6179c9a","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:b5371047224729886d81a44c4d5d1a5958193f07db52aa5bba8facc45efb5551","observation_id":"87e5bfe6-1181-4e54-9137-0accfcdf1905","resolution":{"observed_at":"2026-07-01T21:06:13.842211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":"2604.18564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-07-07T15:43:53.813844Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","venue":"cs.CV","work_id":"334cd115-9c3c-4a4d-80f4-35a6e6179c9a","year":2026},"citing_paper":{"arxiv_id":"2606.02436","last_updated":"2026-06-01T16:08:43Z","snapshot_observed_at":"2026-08-02T13:17:50.493694Z","submitted_at":"2026-06-01T16:08:43Z","title":"Geometry-Aware Implicit Memory for Video World Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T15:27:55.009337Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2606.02436"},"observation_digest":"sha256:3602a366616baf1528373e9a09b3e0715915499002d3e3dd410c867ba414bcc5","observation_id":"be901613-2e70-40d7-abfe-5d91c5b72e3e","resolution":{"observed_at":"2026-07-01T22:26:16.861911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":"2604.18564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-07-07T15:43:53.813844Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","venue":"cs.CV","work_id":"334cd115-9c3c-4a4d-80f4-35a6e6179c9a","year":2026},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:c9582bcd081467a0bde1a44fca232c5593849fe47ba19277d85a02128d9afc28","observation_id":"ccd5c133-682f-4350-b17d-1b1b28bbd845","resolution":{"observed_at":"2026-07-01T22:56:20.221646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":"2604.18564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-07-07T15:43:53.813844Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","venue":"cs.CV","work_id":"334cd115-9c3c-4a4d-80f4-35a6e6179c9a","year":2026},"citing_paper":{"arxiv_id":"2606.09507","last_updated":"2026-06-08T13:59:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-08T13:59:50Z","title":"Prisma-World: Camera-Controllable Multi-Agent Video World Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T17:03:29.676482Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2606.09507"},"observation_digest":"sha256:035f7a51712b1d8f431d3b7c33dfe669122bd6fbec147ad2e157f28ac1d7c08e","observation_id":"03a0f269-6d9b-40f7-867d-f225ec4e680f","resolution":{"observed_at":"2026-07-03T00:47:30.135452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":"2604.18564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-07-07T15:43:53.813844Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","venue":"cs.CV","work_id":"334cd115-9c3c-4a4d-80f4-35a6e6179c9a","year":2026},"citing_paper":{"arxiv_id":"2606.16533","last_updated":"2026-07-03T04:30:36Z","snapshot_observed_at":"2026-07-12T13:47:19.539499Z","submitted_at":"2026-06-15T10:37:42Z","title":"Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI","version":2},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-06-27T04:02:53.110012Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2606.16533"},"observation_digest":"sha256:3fe41a4abd83d2432de68a376009e3e897ca347f8957d8d321e09ab68eec3585","observation_id":"b0e18f56-d4dd-4534-9d1d-e9e4547c725f","resolution":{"observed_at":"2026-07-03T17:28:44.927960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":"2604.18564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-07-07T15:43:53.813844Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","venue":"cs.CV","work_id":"334cd115-9c3c-4a4d-80f4-35a6e6179c9a","year":2026},"citing_paper":{"arxiv_id":"2606.26694","last_updated":"2026-06-28T04:16:09Z","snapshot_observed_at":"2026-07-07T00:01:01.437499Z","submitted_at":"2026-06-25T07:27:09Z","title":"PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T05:46:21.198781Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2606.26694"},"observation_digest":"sha256:cbce4c62970091eb9a4fd4b627f9aae0bc0a683ba75acb144e583cfc07fa827d","observation_id":"d56473b4-56ce-46d1-95de-cb66d2b95aef","resolution":{"observed_at":"2026-07-04T12:49:53.213197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":"2604.18564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-07-07T15:43:53.813844Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","venue":"cs.CV","work_id":"334cd115-9c3c-4a4d-80f4-35a6e6179c9a","year":2026},"citing_paper":{"arxiv_id":"2606.26694","last_updated":"2026-06-28T04:16:09Z","snapshot_observed_at":"2026-07-07T00:01:01.437499Z","submitted_at":"2026-06-25T07:27:09Z","title":"PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T10:19:06.268547Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2606.26694"},"observation_digest":"sha256:37665de8ab7b4acd04047b8a14e5365aec8629bdd761a13b1ac4e97d11a6606a","observation_id":"75a40edf-6d53-4a04-8c8d-8cc9db25f8bf","resolution":{"observed_at":"2026-06-30T12:04:39.344272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":"2604.18564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-07-07T15:43:53.813844Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","venue":"cs.CV","work_id":"334cd115-9c3c-4a4d-80f4-35a6e6179c9a","year":2026},"citing_paper":{"arxiv_id":"2607.05352","last_updated":"2026-07-06T17:31:52Z","snapshot_observed_at":"2026-08-05T02:41:56.861095Z","submitted_at":"2026-07-06T17:31:52Z","title":"Multiplayer Interactive World Models with Representation Autoencoders","version":1},"reference_index":300,"source":"arxiv_source","source_observed_at":"2026-07-07T15:38:36.897705Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2607.05352"},"observation_digest":"sha256:3d282e911bd287d02f1c64b11af73ccb1698a457a866edfb89bf86d923b0b2bf","observation_id":"f77dedd3-eaaa-40e5-a261-ff3e3ab785b0","resolution":{"observed_at":"2026-07-07T15:43:53.815079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-07-30T22:05:36.746705Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26754","last_updated":"2026-07-29T10:49:30Z","snapshot_observed_at":"2026-08-02T17:20:51.825552Z","submitted_at":"2026-07-29T10:49:30Z","title":"StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-30T22:05:36.746705Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2607.26754"},"observation_digest":"sha256:199ae8307542d9329851e5aeb70d3cc478ff6356d7afd2c1bdb5f2bea8b09641","observation_id":"ae2e1b33-f6fe-4fd6-aea1-2e8fe2a4faa9","resolution":{"observed_at":"2026-07-30T22:05:36.746705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-08-01T08:28:04.207053Z","title":"MultiWorld: Scalable multi-agent multi-view video world models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27380","last_updated":"2026-07-29T18:38:23Z","snapshot_observed_at":"2026-08-02T23:26:16.524563Z","submitted_at":"2026-07-29T18:38:23Z","title":"VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T08:28:04.207053Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2607.27380"},"observation_digest":"sha256:09064a305bc7f7b12945d9508e6c59a8e05dad768ceb2e478d314495f3902223","observation_id":"e4f7ed63-eeba-4fad-956f-72f2277338e0","resolution":{"observed_at":"2026-08-01T08:28:04.207053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.18564/citation-record","integrity":"/paper/2604.18564/integrity","json":"/paper/2604.18564/citation-record.json","paper":"/paper/2604.18564"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems37, 58757–58791 (2024) 4","venue":null,"work_id":"11cdf953-2881-4aef-b8c2-235c6b4b8d6a","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:9718109943c96609ee535dc1e02a7447ea9537d4cf0aca5ae9fd8783578e4031","observation_id":"ac817bfa-f09f-4353-ae12-6f4b56972761","resolution":{"observed_at":"2026-05-22T00:05:48.646171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems35, 24639–24654 (2022) 9, 2","venue":null,"work_id":"2c3f8a75-e587-45aa-843c-9a7fe109d4cf","year":2022},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:dbe7418fe25017574baaedb448b16a25b7e2419e60e29cb229c9b65f5dcf87f9","observation_id":"e00e8b64-7514-4fb8-a622-caf07b839dc6","resolution":{"observed_at":"2026-05-22T00:05:48.651132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"456a6a75-d728-4397-9c5d-ac683d41469d","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:199c489b11657aeda36072724a46c463af966e30a7930412a143faa36c257f0c","observation_id":"0b86ad02-fa15-4d24-9f83-8fc9ccbd97b3","resolution":{"observed_at":"2026-05-22T00:05:48.633970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Forty-first International Conference on Machine Learning (2024) 4","venue":null,"work_id":"8b859d0a-9316-4ccc-ae8a-5e2a6537ef10","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:69fb93c228c2f9fdc0bb04727353dae94b0d6c19b602ef200692fed75429c514","observation_id":"5a193bcd-b53f-4f4f-b9c2-09260097ee5b","resolution":{"observed_at":"2026-05-22T00:05:48.639138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18797","last_updated":"2025-08-26T08:29:05Z","snapshot_observed_at":"2026-08-05T16:16:26.889829Z","submitted_at":"2025-08-26T08:29:05Z","title":"CausalMACE: Causality Empowered Multi-Agents in Minecraft Cooperative Tasks","version":1},"cited_work":{"arxiv_id":"2508.18797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18797","snapshot_observed_at":"2026-07-03T21:28:58.652264Z","title":"arXiv preprint arXiv:2508.18797 (2025) 4","venue":null,"work_id":"b6fa645c-e9a2-40b4-bd94-a67009f031da","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2508.18797","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:98c57362fb1531e10152d25831c2801f2b3b7211d219f8fea23e0e08ee41a5ba","observation_id":"d1bdc81e-1078-4dba-b2d5-d8f54f27b382","resolution":{"observed_at":"2026-05-10T10:09:08.162793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:16:36.370407Z","title":"Wow: Towards a world omniscient world model through embodied interaction","venue":null,"work_id":"a017f7e5-e19f-4d95-9a08-adad24ce0535","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:65a7e0de9104787d5ce42a150626ce634b9498cd5c75d82b53670d79f88fc33c","observation_id":"da040655-c397-4101-9eae-3b98c0dd5db3","resolution":{"observed_at":"2026-05-10T10:09:08.284186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1689a321-1d05-4a6a-9024-af3904b6852d","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:4db76722c81edb2620be766e1b484973b6197320fafa830c7e2cd138c99c5d63","observation_id":"c1650e7b-5dee-4b87-a185-4c05a4117d9e","resolution":{"observed_at":"2026-05-22T00:05:48.636366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.00983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:54.342857Z","title":"Worldscore: A unified evaluation benchmark for world generation","venue":null,"work_id":"ad14fa35-72b1-4530-b01a-6d41cd35888d","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:b1872069ceaf3aff301642e4cc31570525e3615ced9ce4d05d02e43c1ce4c1af","observation_id":"46e1093b-8714-456b-9e90-8185186454d6","resolution":{"observed_at":"2026-05-10T10:09:08.278708Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fe30b824-e863-4cc1-ad11-0af26c8f717b","year":null},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:9cdffb591e5a0c716f45180d0a49daf1b8bbc910fe6ba8a4bcdecd29a5a463a9","observation_id":"5ddde55c-970d-40c5-8f8e-bbc0c8e4553d","resolution":{"observed_at":"2026-05-22T00:05:48.641417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03568","last_updated":"2024-12-04T18:59:05Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:59:05Z","title":"The Matrix: Infinite-Horizon World Generation with Real-Time Moving Control","version":1},"cited_work":{"arxiv_id":"2412.03568","doi":"10.48550/arxiv.2412.03568","metadata_source":"pith","pith_arxiv_id":"2412.03568","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The matrix: Infinite-horizon world generation with real-time moving control","venue":"cs.AI","work_id":"11e7c591-d2c5-4d62-9b5e-f9078c35db2e","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2412.03568","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:6da30f287e208efd2b7fa12669a626dc67455de85b65a86d5895afc932fdd367","observation_id":"cd471cb9-a19e-4564-99c5-356488ce69d2","resolution":{"observed_at":"2026-05-10T10:09:08.230308Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05108","last_updated":"2025-06-21T18:06:15Z","snapshot_observed_at":"2026-07-06T21:20:51.204774Z","submitted_at":"2025-05-08T10:13:53Z","title":"Multi-agent Embodied AI: Advances and Future Directions","version":2},"cited_work":{"arxiv_id":"2505.05108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05108","snapshot_observed_at":"2026-07-04T19:30:07.949532Z","title":"Multi-agent embodied ai: Advances and future directions","venue":null,"work_id":"19ff099a-ff27-4ab2-a5ac-b9de9a1e8ecf","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2505.05108","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:3985b453241d62187467176207d7bf079a256d8f7777900a96a336a711685fe8","observation_id":"6ec31658-3786-4dbf-84fc-39bcf31aa96d","resolution":{"observed_at":"2026-05-10T10:09:08.121141Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08388","last_updated":"2025-04-11T09:41:04Z","snapshot_observed_at":"2026-07-06T21:07:47.410498Z","submitted_at":"2025-04-11T09:41:04Z","title":"MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft","version":1},"cited_work":{"arxiv_id":"2504.08388","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.08388","snapshot_observed_at":"2026-07-08T10:54:49.297399Z","title":"Mineworld: a real-time and open-source interactive world model on minecraft","venue":"cs.CV","work_id":"51784a48-c98d-430f-92ec-ffa426c300b3","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2504.08388","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:ddd7e0409b4624d63a9b119bd1b230bff5cd692bda59a5a167a00853be6cdb7d","observation_id":"82aea7a1-32dd-4623-8647-368425d087c5","resolution":{"observed_at":"2026-05-10T10:09:08.104402Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2404.02101","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-07-10T01:46:41.167891Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","venue":"cs.CV","work_id":"1c05c278-c023-4ef0-a359-25a41f1065eb","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:58cb8e6249e71df72c1363bd00638c5b94578bacd6332b7443c71eaf8e869b95","observation_id":"8c34021a-b012-4673-9c2a-3e2705f02f27","resolution":{"observed_at":"2026-05-13T02:06:24.067006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems (NeurIPS)33, 6840–6851 (2020) 4","venue":null,"work_id":"8714a8bb-0a74-47ed-a774-3fe5fd495f44","year":2020},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:97318c92ea53ed2511b5635d0cc9c163719fa470372f9ea9e3f4ce0ad35640d6","observation_id":"849db28e-716b-432e-b868-883e2355b07d","resolution":{"observed_at":"2026-05-22T00:05:48.623443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.14357","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:09:52.619867Z","title":"Huang, J","venue":null,"work_id":"d1d76f70-c4ba-468a-8c45-296e334e7c76","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:2a9e04b3d1393bddf18e827367fa1af987342d3544089b51f732393fc34ba117","observation_id":"3c8cbe5a-5cc7-4d56-b344-9f052f8d7cf3","resolution":{"observed_at":"2026-05-10T10:09:08.246549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"94feee41-21e5-420c-a093-76104e6137a4","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:f6ac618de182c181d4aa76805696c44469a5897a7091ee9045bb1f7dc40c651c","observation_id":"6b65f5a9-fff5-4d05-9c8a-c0072136a1d1","resolution":{"observed_at":"2026-05-22T00:05:48.618462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:6cbd9aaa0466b6b081fa8c2b4ca25b4dda160cb2a997e92654b8d187a5753eb5","observation_id":"152fc266-e4a2-4b25-ac6a-109ddffa4dec","resolution":{"observed_at":"2026-05-11T01:36:53.812910Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.19080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:58:58.443652Z","title":"World4rl: Diffusion world models for policy refinement with reinforcement learning for robotic manipulation","venue":null,"work_id":"e23d3168-893b-4b69-8783-cf40191d44f1","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:c8f1562acaa8abcf24d55247c316d5917a028d795bc8924b5f6f13511b60c8e2","observation_id":"c5a65699-e9fc-4acf-ac5e-83ce89290392","resolution":{"observed_at":"2026-05-10T10:09:08.325058Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:aec1f70c3c52be24e0124f35e829ace9c8d64cdcf23ca6c351633cfff8318ea7","observation_id":"a408763d-edde-408b-93e2-fdca568f9cdd","resolution":{"observed_at":"2026-05-10T10:09:08.224769Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: The Eleventh International Conference on Learning Rep- resentations (2023) 4, 6","venue":null,"work_id":"f68baf84-6c87-4d02-ae21-fc0e1bb5ce71","year":2023},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:f1ee38fb7932c2af258fe3136e7e013c24335f6a0d227961ee36d75115016fc5","observation_id":"79a469a7-9061-4959-89ea-94faaaf3d873","resolution":{"observed_at":"2026-05-22T00:05:48.620948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Com- puter Vision and Pattern Recognition Conference","venue":null,"work_id":"662b8f7e-0ef4-463d-a99f-b1fb78647ce6","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:5ef8a4d78dabb9062377d9eb3de1259d98ccf8ee3ff9af75904c093bf241fb80","observation_id":"855698be-dc53-4578-8964-e8040730b60e","resolution":{"observed_at":"2026-05-22T00:05:48.648725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: The Eleventh International Conference on Learning Representations (2023) 6","venue":null,"work_id":"13516227-a509-4508-9b77-71df57e0d08d","year":2023},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:fec5b58ea6e8a6720e579f254bc4d6d761fbbe6c3f90fe8b3827bc3bbdfd5717","observation_id":"02027f57-45dc-42bd-88f6-0b766a378366","resolution":{"observed_at":"2026-05-22T00:05:48.625898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05255","last_updated":"2024-12-06T18:41:16Z","snapshot_observed_at":"2026-08-03T09:04:15.998560Z","submitted_at":"2024-12-06T18:41:16Z","title":"TeamCraft: A Benchmark for Multi-Modal Multi-Agent Systems in Minecraft","version":1},"cited_work":{"arxiv_id":"2412.05255","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05255","snapshot_observed_at":"2026-07-04T00:39:17.292874Z","title":"TeamCraft: A benchmark for multi-modal multi-agent systems in minecraft","venue":null,"work_id":"cd5ef82c-46c9-4242-9f02-9471401628d6","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2412.05255","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:be5617afa4bd303c3198c9bf26af73ef5786fcbba57c9978e13f129d803d7c7b","observation_id":"de2bdad4-1c71-4abc-a008-c44f46821b39","resolution":{"observed_at":"2026-05-10T10:09:08.082912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.13903","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2509.13903 (2025) 5","venue":null,"work_id":"4d615a7b-6f15-4bc3-9d35-9d5035210f35","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:1a3a267dfa7733dd99ec6d3861ca45dc77928358c7ba7f40b5d2abd3bb05955c","observation_id":"81cb4aa5-422f-4417-a266-97c89f5040d6","resolution":{"observed_at":"2026-05-10T10:09:08.078159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"f4619553-1f4a-47e8-be77-38b0e1a48bb2","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:2039b8a49a7efffbed129cff8c448e827309a32b59e9627675f36a3207ea29dd","observation_id":"b5c18be4-b5ae-45cd-9898-2e0834934026","resolution":{"observed_at":"2026-05-22T00:05:48.629182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17744","last_updated":"2025-07-23T17:57:09Z","snapshot_observed_at":"2026-08-06T14:36:41.778601Z","submitted_at":"2025-07-23T17:57:09Z","title":"Yume: An Interactive World Generation Model","version":1},"cited_work":{"arxiv_id":"2507.17744","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.17744","snapshot_observed_at":"2026-07-08T10:54:49.210345Z","title":"Yume: An interactive world generation model","venue":"cs.CV","work_id":"15c931d5-49da-401c-8c91-5b0de83195de","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2507.17744","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:a5f3a5d5d29edf8dd11f77990b280b99a634ad603deb4406498e04af130267d7","observation_id":"6c41cf75-fc68-4a00-9318-e5db94ac5119","resolution":{"observed_at":"2026-05-10T10:09:08.320755Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:0cdc82e573530ea50bcb8bd1af185480af9e9b66aff81d911951b54517374e5f","observation_id":"a1d3144e-8776-4ac3-b493-34198b3f9357","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:254be375446a93ad74f92e00ead602a1b5feb213f89dce4cd79189102840ca7f","observation_id":"b766c1aa-88f1-4c2e-a216-5dfaf37c985c","resolution":{"observed_at":"2026-05-10T10:09:08.329781Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"URL: https://deepmind","venue":null,"work_id":"b0879ed9-94d4-4264-8061-1acb96d4957f","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:f383888d362bd421f102d3dd8a7f0bbf8ec2734a2f3c80fc0682f2fe296d9d4f","observation_id":"274bc389-b3f7-408a-b179-9aeae1a1e52d","resolution":{"observed_at":"2026-05-22T00:05:48.613278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c617e7aa-f7f8-4361-a546-b8dd110c7e1b","year":2023},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:ae5be1e233f812c0766c3f99520167045abdc875d36800dea51b71901d097b3d","observation_id":"7c91f734-6c93-497b-9968-bb787e408b0e","resolution":{"observed_at":"2026-05-22T00:05:48.610707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16408","last_updated":"2025-03-20T17:58:38Z","snapshot_observed_at":"2026-07-30T21:18:54.445306Z","submitted_at":"2025-03-20T17:58:38Z","title":"RoboFactory: Exploring Embodied Agent Collaboration with Compositional Constraints","version":1},"cited_work":{"arxiv_id":"2503.16408","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16408","snapshot_observed_at":"2026-07-03T10:58:02.795943Z","title":"Robofactory: Exploring embodied agent collab- oration with compositional constraints","venue":null,"work_id":"a3e39d0a-2209-4214-bc16-103941f68b68","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2503.16408","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:27a7db716fc7c7ba6e95fa1c48f504f56800decb6a24578dad015b959b5c58f3","observation_id":"58118300-b839-4e23-a34b-b2f7174d221b","resolution":{"observed_at":"2026-05-10T10:09:08.197128Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"ea8a78d6-dd14-4fcc-9180-b681745399c3","year":2022},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:b97e951c6e01ad94559fdd22ec8082aa043007205e9aefc66e70854ba930d31c","observation_id":"142ea380-8285-4c70-a105-94ccc9cc48cb","resolution":{"observed_at":"2026-05-22T00:05:48.616045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20523","last_updated":"2025-03-26T13:11:35Z","snapshot_observed_at":"2026-07-06T20:59:00.415760Z","submitted_at":"2025-03-26T13:11:35Z","title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2503.20523","doi":"10.48550/arxiv.2511.09057","metadata_source":"pith","pith_arxiv_id":"2503.20523","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving","venue":"cs.CV","work_id":"1339e674-d09b-48b4-8e6f-efe55dcab22e","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2503.20523","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:0d33dd54e470c505ab5bfada9b2c70050d78492f8bba1f63be908941e7a77925","observation_id":"a93ffc8a-4247-42e4-b647-5954446be2f9","resolution":{"observed_at":"2026-05-15T13:48:22.447793Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:56:04.679179Z","title":"Solaris: Building a multiplayer video world model in minecraft","venue":null,"work_id":"5267e6c2-fd8e-4a6d-8cf5-15dbba54639d","year":2026},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:c0b6ba6a25ce07bb7cb8046189d98f50bd0220df662317b11704e4c65ba6d9a3","observation_id":"f07dd4d1-cad2-48e9-b4e2-6578b794fded","resolution":{"observed_at":"2026-05-10T10:09:08.213386Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"4c492eb1-9f81-4864-9e88-789b4be3ea21","year":2070},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:9b90a36985fe7468b444b1a72ff5fb97196a5b834afe8d6d0190b42cb398cbbe","observation_id":"4aade728-c520-4688-b984-8390ece331f2","resolution":{"observed_at":"2026-05-22T00:05:48.631816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"cited_work":{"arxiv_id":"2502.06764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06764","snapshot_observed_at":"2026-07-08T03:24:28.724863Z","title":"History-Guided Video Diffusion","venue":"cs.LG","work_id":"7822dfb2-a168-4080-8673-2dfafbe1a2ab","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2502.06764","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:706c2cfb053fecf5637cf8624badc24f3fe2a1bbe8874c880146b728523f8f7a","observation_id":"1b8f098e-3fba-45b3-a990-2f491d2d1eaf","resolution":{"observed_at":"2026-05-16T12:00:14.880011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09822","last_updated":"2025-09-08T09:09:36Z","snapshot_observed_at":"2026-08-05T20:48:53.507936Z","submitted_at":"2025-08-13T13:54:51Z","title":"Physical Autoregressive Model for Robotic Manipulation without Action Pretraining","version":4},"cited_work":{"arxiv_id":"2508.09822","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09822","snapshot_observed_at":"2026-07-03T00:47:30.112530Z","title":"Physical autoregressive model for robotic manipulation without action pretraining","venue":null,"work_id":"865426db-67c2-4d48-992a-fd0d31a2e016","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2508.09822","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:5a1dfac3403340da827cafd1570ea7e69266916440970cbdb96815c3eb9bf449","observation_id":"a77e24e7-1ade-4bfc-9f43-e84a7e868cd2","resolution":{"observed_at":"2026-05-10T10:09:08.087732Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neurocomputing568, 127063 (2024) 6","venue":null,"work_id":"5ce734ea-512d-48ba-a907-948bc9c1d98c","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:43b74b1ac4b552341a18976496df0c802ff7642123aaaf21d84e82ea4256facf","observation_id":"fd93f00b-6852-4f7b-8556-562cd3a38c16","resolution":{"observed_at":"2026-05-22T00:05:48.643658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.166628Z","title":"Hunyuan-gamecraft-2: Instruction-following interactive game world model","venue":null,"work_id":"49842da5-5896-4a8d-a8df-fe0f89b249d6","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:652158ee57616f2ba9bb35ea7b68a6491474a06144ca4fc5899ef3cf13b34b3d","observation_id":"7ea35266-0270-4f72-a321-660386517340","resolution":{"observed_at":"2026-05-10T10:09:08.152662Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b366d67a-e6c9-48d8-8fd1-15d75a3b7bb9","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:d7a69018cdf904d9d83033e645053b240cc08e80e3da5361c5d1977877a88636","observation_id":"1036c39a-fcff-4dba-950e-d31cbd8ca51d","resolution":{"observed_at":"2026-05-22T00:05:48.606109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-03T01:29:14.204066Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"cited_work":{"arxiv_id":"2601.20540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.20540","snapshot_observed_at":"2026-07-10T08:36:59.816756Z","title":"Advancing Open-source World Models","venue":"cs.CV","work_id":"3446760e-6460-429e-82f6-6a5133ce4c8a","year":2026},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2601.20540","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:703abfda44ff2dbb3b53192736638ddc01eadee3cfdf31aaccac9976516748a2","observation_id":"57b9820a-4ea4-4813-bfab-22d0a85728f0","resolution":{"observed_at":"2026-05-16T09:07:01.203118Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems34, 16558–16569 (2021) 2 MultiWorld 19","venue":null,"work_id":"e4e8575c-28d8-4ba0-8c1b-cf4a92d43727","year":2021},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:40c0c69efc1bf3df052300a4c171e6562139d81e0475e3541d36575ce708797d","observation_id":"29d970c1-b79b-4c7e-b8b8-3f8998364189","resolution":{"observed_at":"2026-05-22T00:05:48.603613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":"1812.01717","doi":"10.48550/arxiv.1812.01717","metadata_source":"pith","pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","venue":"cs.CV","work_id":"72f42543-17d5-49aa-ba5a-25d67ffbb88a","year":2018},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:4e6e63a0246368bc5e06916152dd18285478a6928d176023569892a3c6df97bc","observation_id":"da8cf3f0-59b8-4d7a-b6f4-dce521a6f53a","resolution":{"observed_at":"2026-05-11T07:21:21.605786Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":"2408.14837","doi":"10.48550/arxiv.2408.14837","metadata_source":"pith","pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffusion Models Are Real-Time Game Engines","venue":"cs.LG","work_id":"3f074579-63c2-40bf-b5c8-c6a8c39d9319","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:7368b3bad193c5fc40bf9ade8676805b7c2ae0dd7681332df3cf47a0322900e6","observation_id":"64cb15b5-270b-4a3f-8412-2882978dae53","resolution":{"observed_at":"2026-05-16T12:04:44.468386Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Pro- cessing Systems (NeurIPS)30(2017) 6","venue":null,"work_id":"9b35ad4b-39c0-4fac-a631-0a49edd2154e","year":2017},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:134a5bbbfbfd97e1bb19dfed860198061f48078398eb5d0fb16026e97a58c7ee","observation_id":"7a91c30a-ae0e-4d2d-8913-ac4e3ff0237e","resolution":{"observed_at":"2026-05-22T00:05:48.595679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:c053c4eca97d0bd1c23b5837341c1dccecfc371f78bba6b5de4fc6d14cbccc4b","observation_id":"cf7b8f37-5d78-4c77-9be5-0e403e46df9a","resolution":{"observed_at":"2026-05-10T10:09:08.157614Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.12437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:47:30.168916Z","title":"Enhancing physical consistency in lightweight world models.arXiv preprint arXiv:2509.12437","venue":null,"work_id":"a4f5e5de-5fe1-498c-8834-f0aae0d9c062","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:1065db109ad4541e3031c157efe79d53a7424411bb366fa5214df4edf46b95a4","observation_id":"beb3094d-7cf2-40c0-831d-c5606ef5ce85","resolution":{"observed_at":"2026-05-10T10:09:08.072889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Confer- ence on Computer Vision and Pattern Recognition (2025) 7, 12","venue":null,"work_id":"8d23d397-593f-439b-9cc2-431715c14a31","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:435dc2850095e0632f11ca90ada2ddae5d6362bf27d1e38862d29d44c13f3c44","observation_id":"5e885f98-3f08-4269-a203-f59fdcf33e61","resolution":{"observed_at":"2026-05-22T00:05:48.598392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08153","last_updated":"2025-03-11T08:10:03Z","snapshot_observed_at":"2026-08-05T04:09:10.445597Z","submitted_at":"2025-03-11T08:10:03Z","title":"WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2503.08153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.08153","snapshot_observed_at":"2026-07-04T13:19:51.064913Z","title":"Wisa: World simulator assistant for physics-aware text-to-video generation","venue":null,"work_id":"faa75e3b-50f4-44b5-bfe5-65f0dc911f7e","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2503.08153","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:ebf253a9f86cd46830d414125ec5f9938baa86865b30142c4a39546251b55388","observation_id":"e07d5669-1b13-4750-9ed0-f2ea2ccbb147","resolution":{"observed_at":"2026-05-10T10:09:08.334017Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-07-06T17:17:23.567885Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":"2401.09985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-10T07:26:54.481828Z","title":"WorldDreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985","venue":"cs.CV","work_id":"9f18e581-221b-41ef-95a4-5de4c12a8c5f","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:10d15ae562a47188d933515b2457dd840785a281583bee0810597fdc7508fd72","observation_id":"fb69bb43-94cd-4a36-832a-1e1c72498613","resolution":{"observed_at":"2026-05-10T10:09:08.137060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:46:26.999203Z","title":"IEEE transactions on image processing 13(4), 600–612 (2004) 9","venue":null,"work_id":"d15828ad-b914-48f3-a3a5-11018ede7ee0","year":2004},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:574de5b898b99c40da59b500e4ce78621ecf6649f40d976f1fb3ee166f4fa9da","observation_id":"8efc638b-1aa3-44bd-898a-6f09d0d95042","resolution":{"observed_at":"2026-05-22T00:05:48.601185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-04T10:05:27.686733Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"cited_work":{"arxiv_id":"2507.07982","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.07982","snapshot_observed_at":"2026-07-07T14:33:54.305490Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","venue":"cs.CV","work_id":"7c214f4a-d3ff-48e7-bd13-043eb9c139cb","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2507.07982","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:05e3fcf94a56b14dfd3cdd574710f4a1e8e8156244a8f00a0518ea1d5117f779","observation_id":"add37847-ac82-4839-8a99-f142ed34eb82","resolution":{"observed_at":"2026-05-10T10:09:08.142101Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T10:54:49.220855Z","title":"Infinite-World: Scaling interactive world models to 1000-frame horizons via pose-free hierarchical memory","venue":null,"work_id":"c6bda419-e0dc-45aa-b96b-eef3a31d0930","year":2026},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:6b02e64706ab36936fa80acdcb34b145e0a13e1d4ae35b5f02e423266ac1e529","observation_id":"c935b75e-5695-48af-a933-7ee968c4df7c","resolution":{"observed_at":"2026-05-10T10:09:08.099023Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-07-06T21:37:28.044836Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:c80c4b25bdc1f203a2f446e8e2b8488f2eb5e84e3033138eb97a6cb3d3b63507","observation_id":"7a7fbba3-4c47-49af-93b7-033e624c2f1e","resolution":{"observed_at":"2026-05-10T10:09:08.116213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.07854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:42:46.795915Z","title":"arXiv preprint arXiv:2602.07854 (2026) 4","venue":null,"work_id":"d7fcacf4-3398-49d9-8f7a-d35989822f42","year":2026},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:e5c03602f9d9025603ee9853629dffac916c1ec00b3282e40ef24ab1c0690646","observation_id":"f743dcca-da4e-4130-962c-2feaa5f7ca05","resolution":{"observed_at":"2026-05-10T10:09:08.132000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.12369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:19:13.356094Z","title":"arXiv preprint arXiv:2504.12369 , year=","venue":null,"work_id":"7159175f-77a7-43d9-8dc3-54bda91b0e0b","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:109295a2ca4033eadd0e4c26c85d0e0fe8eee5b3676d4308973909f1ec11783e","observation_id":"6b5032a9-3094-4fbd-8576-014af2cf0566","resolution":{"observed_at":"2026-05-10T10:09:08.110139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.15281","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:16:17.115464Z","title":"StableWorld: Towards stable and consistent long interactive video generation","venue":null,"work_id":"ab2c77ce-372c-4a53-9607-aa228d0637eb","year":2026},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:2bdee0a64b830ca3f07ec0c079bf7dec94187a095091d75b134f8842f1c4eb57","observation_id":"14201af2-4b71-41b2-9d20-87c161bea26d","resolution":{"observed_at":"2026-05-10T10:09:08.147380Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.12751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:09:52.644138Z","title":"arXiv preprint arXiv: 2512.12751 (2025) 4","venue":null,"work_id":"dc0b6555-1e6b-4ccc-987b-1c62cbb63ce6","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:671073ee0209cc2a887bbe79443bd13ccb2e5c11735a4e6b5b13ac6b8733cd1a","observation_id":"ef1e5876-acbc-40b7-b37b-20a5f2aba219","resolution":{"observed_at":"2026-05-10T10:09:08.185264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08410","last_updated":"2024-12-13T02:05:34Z","snapshot_observed_at":"2026-07-06T20:05:18.939982Z","submitted_at":"2024-12-11T14:29:35Z","title":"Physical Informed Driving World Model","version":2},"cited_work":{"arxiv_id":"2412.08410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08410","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Physical informed driving world model","venue":null,"work_id":"77ea2101-2312-4533-b0c9-e883a7aa5f24","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2412.08410","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:61190d96b3ff3da7f2c97a9e9e97857d1c5fecab1efc96c60a7069ef8f2a4f83","observation_id":"dabfd1d9-faf5-4c98-aa6b-3507fe97cfca","resolution":{"observed_at":"2026-05-10T10:09:08.093011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14070","last_updated":"2025-03-18T09:42:55Z","snapshot_observed_at":"2026-07-06T20:54:32.016138Z","submitted_at":"2025-03-18T09:42:55Z","title":"Fast Autoregressive Video Generation with Diagonal Decoding","version":1},"cited_work":{"arxiv_id":"2503.14070","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14070","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast autoregressive video generation with diagonal decoding","venue":null,"work_id":"563a414a-35ff-48f5-a978-1e928221ac69","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2503.14070","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:47766ffb14f180fb2a9bed77eb5893ad6c60b532bf2d6ac7cd93bd3f6a925278","observation_id":"41ad30c5-8a81-42b0-a546-dd3bf9b2c61b","resolution":{"observed_at":"2026-05-10T10:09:08.257504Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18828","last_updated":"2024-10-04T04:41:06Z","snapshot_observed_at":"2026-08-05T06:14:40.189444Z","submitted_at":"2023-11-30T18:59:20Z","title":"One-step Diffusion with Distribution Matching Distillation","version":4},"cited_work":{"arxiv_id":"2311.18828","doi":"10.48550/arxiv.2311.18828","metadata_source":"pith","pith_arxiv_id":"2311.18828","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Freeman, and Taesung Park","venue":"cs.CV","work_id":"b7f7dc30-a5c5-4364-a21a-2d0a9e50e741","year":2023},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2311.18828","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:38c0ca0387f6432a48a2f5e62f0964dc7ec161a9ce9a1544231be27a7e1d75e4","observation_id":"74c28a57-0ae2-4162-995f-252e05edf971","resolution":{"observed_at":"2026-05-10T10:09:08.208151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-07-06T21:36:01.328140Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:6a7792f82212d0a6c7a1c0f6f33fc04344bb018f053a784423e47a19ba2fd1bb","observation_id":"f4f4daf0-08e0-4e10-9967-4d9d4c0dbb9d","resolution":{"observed_at":"2026-05-10T10:09:08.126250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21853","last_updated":"2025-04-30T17:59:02Z","snapshot_observed_at":"2026-07-06T21:17:09.837496Z","submitted_at":"2025-04-30T17:59:02Z","title":"A Survey of Interactive Generative Video","version":1},"cited_work":{"arxiv_id":"2504.21853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.21853","snapshot_observed_at":"2026-07-03T00:57:29.745635Z","title":"A survey of interactive generative video","venue":null,"work_id":"af6d5617-9cab-4961-8dfe-4aab1dd13a9b","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2504.21853","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:a0cec5eba45dfa07aba57c6db3642f5dca0f572dc93f7e0236d26862d0ec2eb0","observation_id":"e5555ba1-45b7-4cf2-9cf8-19eb82e51635","resolution":{"observed_at":"2026-05-10T10:09:08.251632Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"88cdd8cf-ee6d-4f38-99c4-24353a5ef27d","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:825dbf2f5197493e83afacda54dfd076eef28427c51bf75d512c9c8d3c9112f3","observation_id":"81c667e8-ff91-425b-9df6-ecbc460f950c","resolution":{"observed_at":"2026-05-22T00:05:48.608511Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02048","last_updated":"2024-09-03T16:53:19Z","snapshot_observed_at":"2026-07-06T19:09:55.393720Z","submitted_at":"2024-09-03T16:53:19Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","version":1},"cited_work":{"arxiv_id":"2409.02048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02048","snapshot_observed_at":"2026-07-07T14:03:48.606626Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","venue":"cs.CV","work_id":"af2e8736-e001-407f-b94e-21e98f89ec55","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2409.02048","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:2030f295e855cfa8f3c56392fd45e0409694a0e0313c46a2465836fb15383378","observation_id":"e85360bf-f5f9-4c7b-9785-3414f8bf88e6","resolution":{"observed_at":"2026-05-13T22:59:04.050916Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.04379","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.244905Z","title":"Improved distribution matching distillation for fast image synthesis.Advances in neural information processing systems, 37:47455–47487, 2024a","venue":null,"work_id":"005eb8db-424f-4973-a65a-d7f9c23eac02","year":2026},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:53cbdc71ce77f1a427c5df743ad667a597d04941d20de83ba84f363bda20b0b4","observation_id":"47e2aabe-dcde-49e5-83bb-5236a69b2af0","resolution":{"observed_at":"2026-05-10T10:09:08.311621Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10775","last_updated":"2025-04-16T00:50:58Z","snapshot_observed_at":"2026-08-04T08:45:22.395523Z","submitted_at":"2024-04-16T17:59:11Z","title":"COMBO: Compositional World Models for Embodied Multi-Agent Cooperation","version":3},"cited_work":{"arxiv_id":"2404.10775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10775","snapshot_observed_at":"2026-07-01T21:06:14.301994Z","title":"Combo: compositional world models for embodied multi-agent cooperation","venue":null,"work_id":"c6052e6f-71c6-4c30-85d0-921f17e9a76e","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2404.10775","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:73218f6dd597a9153a1fb87e4bcd648d91098057edc02d9456636dd55713234d","observation_id":"5d5670f7-947a-4b40-a093-a747e46f6716","resolution":{"observed_at":"2026-05-10T10:09:08.295195Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":"d26314dc-439e-4316-8c33-89f83ad5da28","year":2018},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:792236687cca3fe91edce13d43638b681a09408e90fa9f0c891906809f22fe93","observation_id":"81df16ae-3b0b-4264-8836-56e6e434f8be","resolution":{"observed_at":"2026-05-22T00:05:48.591248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.13095","last_updated":"2026-04-04T14:43:35Z","snapshot_observed_at":"2026-08-03T10:58:40.396117Z","submitted_at":"2025-09-16T13:52:30Z","title":"Empowering Multi-Robot Cooperation via Sequential World Models","version":3},"cited_work":{"arxiv_id":"2509.13095","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.13095","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Empowering Multi-Robot Cooperation via Sequential World Models","venue":"cs.RO","work_id":"17e6deee-fcf1-407b-bd03-492a9b23f8ae","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2509.13095","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:461a4b60f12c625dad1627fc14d4c4ebc7123e065006d8a6a53f1c4ec1312722","observation_id":"e2a668b0-3ca7-45bf-81b6-b2179903c941","resolution":{"observed_at":"2026-05-10T10:09:08.289912Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20995","last_updated":"2025-04-29T17:59:30Z","snapshot_observed_at":"2026-08-06T06:47:39.938557Z","submitted_at":"2025-04-29T17:59:30Z","title":"TesserAct: Learning 4D Embodied World Models","version":1},"cited_work":{"arxiv_id":"2504.20995","doi":"10.48550/arxiv.2504.20995","metadata_source":"pith","pith_arxiv_id":"2504.20995","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2504.20995 (2025)","venue":"cs.CV","work_id":"3a971c23-d9fe-4291-9743-6a2b015ce29b","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2504.20995","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:8a5084631cedb7a5e861555440986577d24781e241a4311202b3df538b5fcf07","observation_id":"f669549c-0ad0-48db-8eec-4c2346cf5abe","resolution":{"observed_at":"2026-05-10T10:09:08.305357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"cited_work":{"arxiv_id":"2505.15659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15659","snapshot_observed_at":"2026-07-10T12:47:05.520966Z","title":"FLARE: Robot Learning with Implicit World Modeling","venue":"cs.RO","work_id":"0734908a-7122-4eeb-ba5d-944092bb8897","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2505.15659","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:e3a1fbd9d1cf67fbdc31dad4b90c2be43390924c3068e95a122738f4ef31234f","observation_id":"11b127d7-9aad-4674-b85d-ae438dffea87","resolution":{"observed_at":"2026-05-17T15:59:09.111136Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00603","last_updated":"2025-07-01T09:36:38Z","snapshot_observed_at":"2026-07-06T21:50:21.223778Z","submitted_at":"2025-07-01T09:36:38Z","title":"World4Drive: End-to-End Autonomous Driving via Intention-aware Physical Latent World Model","version":1},"cited_work":{"arxiv_id":"2507.00603","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00603","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"World4drive: End-to-end autonomous driving via intention-aware physical latent world model.ArXiv, abs/2507.00603","venue":null,"work_id":"0560de60-63b0-402a-8674-64c8f388bded","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2507.00603","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:3d4281089c91f2916716f902b12a60e1719719db0edfaead8eef30cf25f4df1f","observation_id":"d74bd310-6264-4902-b8a1-542f03462abe","resolution":{"observed_at":"2026-05-10T10:09:08.267982Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Interna- tional Conference on Computer Vision","venue":null,"work_id":"2b8f238a-f18d-4910-a08e-35fb26ce8b5a","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:6b89fab5879eacf27b03bf7742ab96d5a3235d405bab28e7888f17236a2817d7","observation_id":"54d1dc44-afd9-4e3b-9710-67dc3997579c","resolution":{"observed_at":"2026-05-22T00:05:48.593502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.09515","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:58:58.483382Z","title":"Wmpo: World model-based policy optimization for vision-language-action models","venue":null,"work_id":"17e0dd89-e1b0-48ae-84f1-cc651f3e5349","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:5f884c71e24c650ce340595414660d796313e6a5e4851e08dd49bb00e632dcf5","observation_id":"26ae13cc-50c5-47b5-b187-54ed21290aba","resolution":{"observed_at":"2026-05-10T10:09:08.262904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"cited_work":{"arxiv_id":"2602.02214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.02214","snapshot_observed_at":"2026-07-10T13:47:05.847304Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","venue":"cs.CV","work_id":"04f67f5b-e79a-4ad9-8e90-763e5e54bd3d","year":2026},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2602.02214","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:572a1fa9d980ddf44c68483af5a2f086459acdf39b15b997027f7b6808a249aa","observation_id":"adec6b52-7c3c-4f82-a9e8-5ce15828706c","resolution":{"observed_at":"2026-05-21T17:32:01.900965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":37,"parse_uncertain":0,"unresolved":7,"verified_exact":13,"verified_fuzzy":18},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 13 inbound Pith citation observations for arXiv:2604.18564."}