{"as_of":"2026-08-15T13:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bac1cc58cb0eddfbf80dbc856f531f9aebdac9fcb12766ba5f49fff93ea62d62","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T14:52:30.406683Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:17:29.537068Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T15:43:53.784237Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"cited_work":{"arxiv_id":"2606.02753","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.02753","snapshot_observed_at":"2026-07-07T15:43:53.784237Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","venue":"cs.CV","work_id":"5a60ec5b-8900-4ebe-9db7-f716a37f281e","year":2026},"citing_paper":{"arxiv_id":"2607.05352","last_updated":"2026-07-06T17:31:52Z","snapshot_observed_at":"2026-08-13T00:57:38.791673Z","submitted_at":"2026-07-06T17:31:52Z","title":"Multiplayer Interactive World Models with Representation Autoencoders","version":1},"reference_index":226,"source":"arxiv_source","source_observed_at":"2026-07-07T15:38:36.897705Z"},"links":{"cited_paper":"/paper/2606.02753","citing_paper":"/paper/2607.05352"},"observation_digest":"sha256:f142bb8fd23b2e36d7724534cdd1a09ec49ca6648bf02cb367e9635fead890d1","observation_id":"12b27ae4-c56c-4e48-a8f8-42764d057bd3","resolution":{"observed_at":"2026-07-07T15:43:53.785561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02753","snapshot_observed_at":"2026-08-04T17:55:19.709947Z","title":"arXiv preprint arXiv:2606.02753 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.709947Z"},"links":{"cited_paper":"/paper/2606.02753","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:ce27648a95db70666fcc868ca835efd869a513438e21361075bd947fe795d0c9","observation_id":"3b4f27d2-e2df-4162-9f11-07a1c519cf7c","resolution":{"observed_at":"2026-08-04T17:55:19.709947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02753","snapshot_observed_at":"2026-08-11T04:17:29.537068Z","title":"MetaWorld: Scaling multi-agent video world model from single-view video data","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06257","last_updated":"2026-08-10T06:56:03Z","snapshot_observed_at":"2026-08-14T09:50:52.946105Z","submitted_at":"2026-08-06T16:47:24Z","title":"MASS: Multiplayer World Models with Authoritative Shared State","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:29.537068Z"},"links":{"cited_paper":"/paper/2606.02753","citing_paper":"/paper/2608.06257"},"observation_digest":"sha256:90ea0d0184f0328debffbda061288b27920eb31ab831d19fa9d832b246a7924b","observation_id":"55394263-6851-4cf1-b707-226a17dfcf97","resolution":{"observed_at":"2026-08-11T04:17:29.537068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.02753/citation-record","integrity":"/paper/2606.02753/integrity","json":"/paper/2606.02753/citation-record.json","paper":"/paper/2606.02753"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:21fb60084b0eaeb44fd3fd10b3f08115c2fa36c51d66ad46a1c7f82ffc040f1b","observation_id":"30268d65-7cdf-441f-84b9-7e946dcd5198","resolution":{"observed_at":"2026-07-01T22:56:20.215141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:30.406683Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:e0778bf2fc2cd88cb47f06a769cc9e322604f36d0e075df21b1d451cbe5b2558","observation_id":"7cb58893-d6cf-4476-af5b-0271d4aaf8c4","resolution":{"observed_at":"2026-06-28T14:52:30.406683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:30.406683Z","title":"Brooks, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:1d89f6efcc693a76adec249d47b3a65db95a31287a4ab40537e7738248548390","observation_id":"cad8fcc6-282c-46f3-a345-97f1dd5a34e9","resolution":{"observed_at":"2026-06-28T14:52:30.406683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.21058","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:59:42.121465Z","title":"Mixture of contexts for long video generation.arXiv preprint arXiv:2508.21058","venue":null,"work_id":"b800ec2a-ab41-48e3-a98d-a26b4942bb2a","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:cfbd2dfc42a390a9ae4c607af3f8eabd426bd5af6d7a7598e86db76e7d442690","observation_id":"c4fc9fe8-7d96-4f5c-9542-08081238f348","resolution":{"observed_at":"2026-07-01T22:56:20.208456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:30.406683Z","title":"Esser, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:77c972f5cfc395b05b3dfa77c7ec82aa551b0bab9e0552ddbd15269b9160c691","observation_id":"30ae6dd6-5eee-4b26-9955-0af229ec588e","resolution":{"observed_at":"2026-06-28T14:52:30.406683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":"2301.04104","doi":"10.1126/sciadv.adu2488","metadata_source":"pith","pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Diverse Domains through World Models","venue":"cs.AI","work_id":"6aeb260f-8c7c-4f9c-b98b-067cd7c59acd","year":2023},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:1ca0161cd47504035cef591912c7ab729c64c675527362984c3160dfd098b5b2","observation_id":"7c18e6ce-d200-455c-be65-b08255bdd3e4","resolution":{"observed_at":"2026-07-01T22:56:20.211799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:30.406683Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:9e322061fc989bf8a6b0f6124c7e8c40fac834ceb0e619b93efab239a22781d4","observation_id":"cda59d6b-6dce-437e-bc5f-af5d96b49208","resolution":{"observed_at":"2026-06-28T14:52:30.406683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04040","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:07.566418Z","title":"Relic: Interactive video world model with long-horizon memory.arXiv preprint arXiv:2512.04040","venue":null,"work_id":"d398db79-a718-4fff-a215-641fd1af997a","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:2c819ab999bae3e60063cd3c448ef7db1351cc07a4a639f2dc3da28bbcb0e123","observation_id":"5f212afc-4035-451c-80aa-1def4af78d03","resolution":{"observed_at":"2026-07-01T22:56:20.193843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.21579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:07:28.143954Z","title":"Harmony: Harmonizing audio and video generation through cross-task synergy","venue":null,"work_id":"2ee404a6-4351-42e2-b890-4024fc23222b","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:bebe44d3f7b9696b7c02aeaff24e0124ba1a8471136292d4da49dcd5accfe435","observation_id":"1d82aa49-6236-4dba-b6b2-26d20c63e20a","resolution":{"observed_at":"2026-07-01T22:56:20.204489Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:45cd6a7f7a6eacbea1d4869f77f065e8403fd237cbf095bcb71670ef9dc35fce","observation_id":"a795f952-7525-4266-a9d2-855d4aa99514","resolution":{"observed_at":"2026-07-01T22:56:20.256912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-14T18:10:59.134916Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"cited_work":{"arxiv_id":"2506.07848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07848","snapshot_observed_at":"2026-07-01T22:56:20.169424Z","title":"Polyvivid: Vivid multi-subject video generation with cross-modal interaction and enhancement","venue":null,"work_id":"b4a9289e-29a2-47d9-8ce8-c72eef2327b2","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2506.07848","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:9c4dcc165b7f6a047e07085d82ed3f0b817398488273378d8fd661c7b8740c82","observation_id":"49a8ca39-c798-42c2-9a7a-58f88f3ce637","resolution":{"observed_at":"2026-07-01T22:56:20.171795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.18775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:07:28.129572Z","title":"arXiv preprint arXiv:2510.18775 (2025) 1","venue":null,"work_id":"545344af-a4d7-4dda-b3b2-ce7c689dbb0e","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:7087e439f4cd82df46cf97012ccb42c9ec16a0549b2f3e45cbc8d4f60a05e53b","observation_id":"b1d17642-b7ff-4a2e-9d2f-fa178ab3dcbc","resolution":{"observed_at":"2026-07-01T22:56:20.179859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"cited_work":{"arxiv_id":"2604.06339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.06339","snapshot_observed_at":"2026-07-03T00:07:28.026728Z","title":"Evolution of Video Generative Foundations","venue":"cs.CV","work_id":"ac3705bc-1299-45ed-aa66-7305ec6cf09b","year":2026},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2604.06339","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:1451a286c0fe1326c40b9889be0e4c3d37f318ef0f7669236dc426ac0a4c97a4","observation_id":"c7a89228-6577-4a09-868b-a46415468e4c","resolution":{"observed_at":"2026-07-01T22:56:20.176106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:94906e3b2908c949c4927d433caa7627e7012234644e5bafb635e18ad08be237","observation_id":"ff6a32b8-7788-42bf-9209-68abc0b213f2","resolution":{"observed_at":"2026-07-01T22:56:20.183088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:30.406683Z","title":"Huang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:292246c1dc6819e0e03a63795c256c11b813b16ed8cb2b38a8a3b315714aa3f1","observation_id":"49cc8523-20df-48ee-8563-38910513bdb7","resolution":{"observed_at":"2026-06-28T14:52:30.406683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.19678","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:56:20.198980Z","title":"Worldwarp: Propagating 3d geometry with asynchronous video diffusion","venue":null,"work_id":"b19eca27-ff4b-4400-8449-0aea632ba3a4","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:3b19cf3a9560335bb83e08fdfd9e925b9e7f7dc781914ddec5fba424531db232","observation_id":"ab3ed2d9-3d59-4e37-bc0d-e280defc9cef","resolution":{"observed_at":"2026-07-01T22:56:20.201082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:646e8246ca09aa68f510b272d22c6d4bbd0185d12f54cda9a30e7b67cfe33f93","observation_id":"e1a0ffad-d8a7-44df-be3f-9568ccfda6b8","resolution":{"observed_at":"2026-07-01T22:56:20.186782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:30.406683Z","title":"LeCun et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:35e76cfc5d1650b7f2511048ff354779a981e7bb2fed6085a334a79a08632258","observation_id":"90c228ca-5c7f-47c6-af6f-3f89b754e77e","resolution":{"observed_at":"2026-06-28T14:52:30.406683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18903","last_updated":"2025-08-14T14:03:30Z","snapshot_observed_at":"2026-08-15T00:06:52.227389Z","submitted_at":"2025-06-23T17:59:56Z","title":"VMem: Consistent Interactive Video Scene Generation with Surfel-Indexed View Memory","version":3},"cited_work":{"arxiv_id":"2506.18903","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18903","snapshot_observed_at":"2026-07-03T17:58:47.750659Z","title":"Vmem: Consistent interactive video scene generation with surfel-indexed view memory","venue":null,"work_id":"8c6afc6c-7c32-41eb-87c1-e51bca941b63","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2506.18903","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:808eefca16c1ebeb9a3dd7a0ff935a83323e603d8d05e78ef56e56cd10c0de47","observation_id":"d23b27c4-f2da-4dae-8c53-36a2b1dd05e3","resolution":{"observed_at":"2026-07-01T22:56:20.197617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.09212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T10:54:49.237140Z","title":"Stable video infinity: Infinite-length video generation with error recycling.arXiv preprint arXiv:2510.09212","venue":null,"work_id":"cefcc1f7-7c1c-4881-9a8a-e91b74f1054c","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:93ac8234345281709763562581bc3b83bed98b53276cda2aa6c43aa517e3c91c","observation_id":"760af4bc-62ce-4ec9-ab57-bb3273541bb1","resolution":{"observed_at":"2026-07-01T22:56:20.269449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:bd123e44a8f9a8b350da291996eefce73396814eadb46c7f45c2e39457e8ff50","observation_id":"54d0a592-7bba-47d0-b7f3-a32634311248","resolution":{"observed_at":"2026-07-01T22:56:20.244659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:30.406683Z","title":"Parker-Holder, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:174f65ae9838659fd3ca2b6c6a8fbd31d5c5cc27c0a73cf137f50daafbb9616c","observation_id":"f066ab91-42b3-4f4f-819b-9b7a4ea7d5ce","resolution":{"observed_at":"2026-06-28T14:52:30.406683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:30.406683Z","title":"Peebles and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:f98370c647aad2ded2cb81bcba400f0f470422adfebb8c0b1620b5fabfd8c0b9","observation_id":"ff08c448-b5b6-4ae3-8c02-ed16c9f8f93b","resolution":{"observed_at":"2026-06-28T14:52:30.406683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:970c6c70e4c7f240a87946f2275fa4aedd0904aa3b0dedf8adcacd51e55c1761","observation_id":"910a0dbd-bc83-4bcf-b0a3-40fb4a3e1bcc","resolution":{"observed_at":"2026-07-01T22:56:20.249388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:30.406683Z","title":"Rombach, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:b826114f1ff192a0e567f1871269cad0b0078fb48c2b8ffc68a39e060fd64f86","observation_id":"6825bd8b-1aa9-4e38-a007-e4cf4c9d2a91","resolution":{"observed_at":"2026-06-28T14:52:30.406683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:56:04.679179Z","title":"Solaris: Building a multiplayer video world model in minecraft","venue":null,"work_id":"5267e6c2-fd8e-4a6d-8cf5-15dbba54639d","year":2026},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:c4c8d472795c8584c33db9bf0d540799bf9e199ca35b08d19a22e37eaa3a025f","observation_id":"0510bee4-5007-4f8e-9242-f8ab48f2a271","resolution":{"observed_at":"2026-07-01T22:56:20.265197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-14T16:23:20.854858Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":2},"cited_work":{"arxiv_id":"2512.14614","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.14614","snapshot_observed_at":"2026-07-09T07:56:04.709254Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","venue":"cs.CV","work_id":"48231e12-6c15-4f28-8c51-092766c59f93","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2512.14614","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:e6f33cb7f1df873b9f611972aa6be01276e59e28ca7be5da1b5e7e6fac34e736","observation_id":"05feb30e-3413-4d88-8ead-26811d471dbc","resolution":{"observed_at":"2026-07-01T22:56:20.235274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:30.406683Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:07e3c78fc73841f6fa5e96df4c0285e0b89c3ba694e51b5e30c8a09cfed5cfe3","observation_id":"32640c83-7986-408a-9028-e3f2eb92ff65","resolution":{"observed_at":"2026-06-28T14:52:30.406683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02546","last_updated":"2025-07-03T11:40:01Z","snapshot_observed_at":"2026-07-06T21:51:38.554688Z","submitted_at":"2025-07-03T11:40:01Z","title":"MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details","version":1},"cited_work":{"arxiv_id":"2507.02546","doi":"10.48550/arxiv.2507.02546","metadata_source":"pith","pith_arxiv_id":"2507.02546","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details","venue":"cs.CV","work_id":"4a287a38-b116-4830-99a0-306010a0c8e5","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2507.02546","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:5844107510ca440c465886adc207b5bc4da36311f212ae816913373c388e1fec","observation_id":"4cf73b09-dfb8-420a-aa00-615b27f19e32","resolution":{"observed_at":"2026-07-01T22:56:20.218401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-08-11T21:17:05.183857Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"cited_work":{"arxiv_id":"2604.18564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18564","snapshot_observed_at":"2026-07-07T15:43:53.813844Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","venue":"cs.CV","work_id":"334cd115-9c3c-4a4d-80f4-35a6e6179c9a","year":2026},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2604.18564","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:9f0917c6b654b54eb60386fc2aa169dfead7e7156ef70243bac1b86b42406a7d","observation_id":"ccd5c133-682f-4350-b17d-1b1b28bbd845","resolution":{"observed_at":"2026-07-01T22:56:20.221646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:abe85c175d2da7c835e936709c9ac8c724cefeda063420b24eda625e5204bb71","observation_id":"15b1745a-4e0f-4613-b3e3-3a22ccec0846","resolution":{"observed_at":"2026-07-01T22:56:20.230079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.12369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:19:13.356094Z","title":"arXiv preprint arXiv:2504.12369 , year=","venue":null,"work_id":"7159175f-77a7-43d9-8dc3-54bda91b0e0b","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:288c1e6ec5233678b3796aa7a8d04c0b439b66d82b70e7ac7a54be5cd9348403","observation_id":"28224c4d-ab02-42c8-85a8-3fdd8c8773ad","resolution":{"observed_at":"2026-07-01T22:56:20.190558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:30.406683Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:d4fc31fdc36a56937895f0f15a4152b7a20afbef2f606303dc78338eb3e2bddc","observation_id":"39f81260-45c1-4003-bf31-f803deb8d273","resolution":{"observed_at":"2026-06-28T14:52:30.406683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:30.406683Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:44205abf4cb863d362c4826656c07e1b2ce013b82e783967cd29df818c917c1e","observation_id":"13280893-3fbc-4b22-9d62-fa0e0ff9b26b","resolution":{"observed_at":"2026-06-28T14:52:30.406683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:eb7222046e5ebf870102db3d5a0b011d968bd97491192053da92fb48a8b84ff5","observation_id":"7a329186-4a0b-40fb-ad3e-a23134ea7ce4","resolution":{"observed_at":"2026-07-01T22:56:20.225592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-10T02:48:41.050656Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:2bd2f6a9d5512a381dd31d81fa8864c3ce47cfc3231155a05da5aa87ea351632","observation_id":"8a09830f-5302-4e12-9481-88fd0609a359","resolution":{"observed_at":"2026-07-01T22:56:20.240121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:30.406683Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:e02c3dab7124630e5d69522df6b2f8f30752eb202818f71d9095de4bc3cd3125","observation_id":"06d5460b-cd3d-444b-bbf6-e299f03d4476","resolution":{"observed_at":"2026-06-28T14:52:30.406683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.15716","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:47:41.306766Z","title":"Spatia: Video generation with updatable spatial memory","venue":null,"work_id":"4c11bcb4-bd32-4925-9e0a-29f40d058eba","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:a1457a99905fce20d4bf1dd74d081ce8971f0fc39d18e17f4958b9fcb488f8b1","observation_id":"b0af4662-02a3-4745-bbf3-cff27b6f1924","resolution":{"observed_at":"2026-07-01T22:56:20.261550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05138","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:56:20.251012Z","title":"billboard","venue":null,"work_id":"5143a3b9-b642-4885-9fd0-d07838b8a20f","year":2026},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:78114d77ac32ffbf1dcfced31cbec4410cb0dccb67124a055747add562695201","observation_id":"7bc3f0e2-68b6-4051-8611-5dee045bc239","resolution":{"observed_at":"2026-07-01T22:56:20.253002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":26,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2606.02753."}