{"as_of":"2026-08-05T05:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66360c6582716dc1610ef66beea5e69db0c88b743ee1750ff0ea516a979a0c41","coverage":[{"denominator":101,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T19:04:58.672464Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T02:52:21.297924Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T07:14:45.272447Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"cited_work":{"arxiv_id":"2606.00793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.00793","snapshot_observed_at":"2026-07-08T07:14:45.272447Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","venue":"cs.CV","work_id":"a46107c8-9b23-4e62-b20b-8574308ca33c","year":2026},"citing_paper":{"arxiv_id":"2606.20545","last_updated":"2026-06-18T17:55:15Z","snapshot_observed_at":"2026-07-06T23:55:38.979306Z","submitted_at":"2026-06-18T17:55:15Z","title":"Current World Models Lack a Persistent State Core","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T17:33:41.461245Z"},"links":{"cited_paper":"/paper/2606.00793","citing_paper":"/paper/2606.20545"},"observation_digest":"sha256:5e86eeb997975f2e049ec96a6e2201849a51188e93e13980829b249612856f88","observation_id":"70403776-aa78-497c-80e5-560eb357732b","resolution":{"observed_at":"2026-07-04T03:49:30.965350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"cited_work":{"arxiv_id":"2606.00793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.00793","snapshot_observed_at":"2026-07-08T07:14:45.272447Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","venue":"cs.CV","work_id":"a46107c8-9b23-4e62-b20b-8574308ca33c","year":2026},"citing_paper":{"arxiv_id":"2607.06401","last_updated":"2026-07-07T15:31:32Z","snapshot_observed_at":"2026-08-03T02:43:03.919769Z","submitted_at":"2026-07-07T15:31:32Z","title":"A Definition and Roadmap for World Models","version":1},"reference_index":279,"source":"arxiv_source","source_observed_at":"2026-07-08T07:10:33.826140Z"},"links":{"cited_paper":"/paper/2606.00793","citing_paper":"/paper/2607.06401"},"observation_digest":"sha256:69bd61dd278b8acd1b657255d80be2abcafdd7947f248c4e76d7c021386cf63d","observation_id":"5a1d00f9-c940-4488-bcce-40c3f1c4b11b","resolution":{"observed_at":"2026-07-08T07:14:45.274747Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.00793","snapshot_observed_at":"2026-08-02T02:52:21.297924Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14076","last_updated":"2026-07-15T17:48:48Z","snapshot_observed_at":"2026-08-02T02:52:11.633120Z","submitted_at":"2026-07-15T17:48:48Z","title":"From Pixels to States: Rethinking Interactive World Models as Game Engines","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-02T02:52:21.297924Z"},"links":{"cited_paper":"/paper/2606.00793","citing_paper":"/paper/2607.14076"},"observation_digest":"sha256:b5114fa5f41fe89f4013490fa516358402521fe440a807034b312456eac62c93","observation_id":"a357498d-905d-409f-bfbb-9cb9e3313398","resolution":{"observed_at":"2026-08-02T02:52:21.297924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.00793","snapshot_observed_at":"2026-08-01T07:46:24.802500Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21686","last_updated":"2026-07-23T14:39:46Z","snapshot_observed_at":"2026-08-03T21:25:48.155923Z","submitted_at":"2026-07-23T14:39:46Z","title":"Persistent Computational State: A Session-Centric Runtime for Generative World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T07:46:24.802500Z"},"links":{"cited_paper":"/paper/2606.00793","citing_paper":"/paper/2607.21686"},"observation_digest":"sha256:e3247244fe167bc84ec0f17560ea65d19bb25ff0f23326a5dac02c489a28d067","observation_id":"1a1b349b-7eca-424a-afc7-de60fb2d1b2a","resolution":{"observed_at":"2026-08-01T07:46:24.802500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.00793/citation-record","integrity":"/paper/2606.00793/integrity","json":"/paper/2606.00793/citation-record.json","paper":"/paper/2606.00793"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"ai, Hansi Teng, Hongyu Jia, Lei Sun, Lingzhi Li, Maolin Li, Mingqiu Tang, Shuai Han, Tianning Zhang, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:b51c726019bf74ae47e184a65a6733c0d114d713a08f1c11cff5b320210dabaf","observation_id":"c72e8d42-85c0-460b-9c30-e022930d004a","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"World simulation with video foundation models for physical ai, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:76018faccc7d877fae8f7b7a3bca6c9905f3fd2c67fce262cb910b2502986193","observation_id":"54ed3b2c-1a34-47af-878e-67a2193ab28b","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Diffusion for world modeling: Visual details matter in atari.Advancesin Neural Information Processing Systems, 37:58757–58791, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:5f3c42906e79affa1831ccb8760c857c7fc01c135d729560c7fb40b8b903da04","observation_id":"c8676be0-69a6-4ce5-9dec-85d06c6113e3","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Physics-aware-videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:3a775c5741c3b84d11174c99f6642b752d45b106906dc00d7e9b319da19ae326","observation_id":"ebc63a4a-24ec-414f-930d-dd2ad5f0ae72","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:8a970fdb18391a67cc032a3f75a18c41710c4537d24503235cc532581758236b","observation_id":"e4d959b3-5dfd-44bf-bb4a-7cf134a0a956","resolution":{"observed_at":"2026-06-28T19:22:35.202367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":"2406.03520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-07-07T15:43:53.689981Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","venue":"cs.CV","work_id":"27ed795c-abbe-4de1-9a7a-2ecf39c354f3","year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:a343f22d60db0b7d5cdab4b53736e74f290aef6f1cb2cef6c2e330986f045112","observation_id":"12a423cc-2705-4888-8b7a-45329c48af5c","resolution":{"observed_at":"2026-06-28T19:22:35.204746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:1ab77bd3933cf05aeb37d0fe84072a2f042ecb3fb204654283d84c69ccb2f333","observation_id":"f9a28301-9eb9-484d-b53d-9d4644c28bc4","resolution":{"observed_at":"2026-06-28T19:22:35.199395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:147784bb70e4b9ad298ba5c6ffa2974e78de5e815228e66874d3698d08d65df5","observation_id":"7b6de40a-3dd3-451b-b082-86da2e4d1892","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Seed2.0 model card: Towards intelligence frontier for real-world complexity","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:c8bf8c3ec5e9209ba8bae3e6719dd9187695fd13856043ef5c306f2a205a271c","observation_id":"16bd7734-fe63-4d9d-b935-97eea23836b0","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion.Advancesin Neural Information Processing Systems, 37:24081–24125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:0c7b0ed4902e4508fd3c1b38de532670097ecaa21f668ce3c856dbfa512c27db","observation_id":"2fe1020b-e50e-47ab-b28b-3bb15f26ffa2","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Skyreels-v2: Infinite-length film generative model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:2d3d5890289afc3a20821bdfe7203b46ec9db79cccdb18dc518ac7a7ee4d28ff","observation_id":"cdc21271-a501-4138-98a9-41bd7f9abd19","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-07-06T16:40:28.142296Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":"2310.19512","doi":"10.48550/arxiv.2310.19512","metadata_source":"pith","pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","venue":"cs.CV","work_id":"4d4486c5-6317-4d8d-bb5b-3b100d732a83","year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:f552350717a571a88583163182dc94ad1d5d4699616e62d027be84265eb947db","observation_id":"257bb731-5de5-4ced-977a-58182c4a0fb9","resolution":{"observed_at":"2026-06-28T19:22:35.146424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21996","last_updated":"2026-05-28T06:02:27Z","snapshot_observed_at":"2026-08-02T19:46:18.834219Z","submitted_at":"2025-05-28T05:55:44Z","title":"VRAG: Learning World Models for Interactive Video Generation","version":4},"cited_work":{"arxiv_id":"2505.21996","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21996","snapshot_observed_at":"2026-07-04T12:49:53.226691Z","title":"VRAG: Learning World Models for Interactive Video Generation","venue":"cs.CV","work_id":"57a65211-475e-412c-a72b-f0519db0d0cb","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2505.21996","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:c578fcc53f50f766f80ce0307c59c7d2702bddd8a4954b998d2bc4d8450f098f","observation_id":"21af5c0e-d3c4-4ad0-b53c-f0055add531d","resolution":{"observed_at":"2026-06-28T19:22:35.179693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06571","last_updated":"2019-09-25T16:37:55Z","snapshot_observed_at":"2026-07-06T08:07:47.943239Z","submitted_at":"2019-07-15T16:27:04Z","title":"Adversarial Video Generation on Complex Datasets","version":2},"cited_work":{"arxiv_id":"1907.06571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.06571","snapshot_observed_at":"2026-07-03T20:08:55.456063Z","title":"2019 , journal =","venue":null,"work_id":"b77c75b7-de8e-4a51-99f7-5093aeed16b3","year":1907},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/1907.06571","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:7d20fa681875c562e563607632e28120fad949f47042b199c188c410d15e1874","observation_id":"633ff394-e41e-4034-8bb0-260d87b2c592","resolution":{"observed_at":"2026-06-28T19:22:35.164769Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"One-minute video generation with test-time training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:be0283d3817b92aff0f4965fb87c846295c6a3f2b79ba4da8b00db98010faf05","observation_id":"8138f958-5592-4ec6-8927-fe2b4b3f67e5","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:67a5e8a9d8d135d61e499faf4bfce4b93320b90916011c83ea236f89defafa85","observation_id":"4c2928de-4a7e-45df-abbc-aaae3c2da9e2","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.00983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:54.342857Z","title":"Worldscore: A unified evaluation benchmark for world generation","venue":null,"work_id":"ad14fa35-72b1-4530-b01a-6d41cd35888d","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:f09722be7ea40c9091139d1f0d63a96969336c01820fb38930c3560ca9e53531","observation_id":"f67022ff-e741-463a-a385-57a93cc4e70d","resolution":{"observed_at":"2026-06-28T19:22:35.133872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability.Advancesin Neural Information Processing Systems, 37:91560–91596, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:302361751763ad4ac30db4a29225ca2ca170ab3cc3535aec53473765cd4330af","observation_id":"60a787f0-fb25-4c30-a95c-4a994c9b8946","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Veo-3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:2a2625cdcb57990b6dd00595a36ecf2b5fb01d18ed73ddc9378e0b245d7f89a5","observation_id":"7c3bdd96-ce1f-45ef-a9ea-36ba8eb7a4ef","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":"2503.19325","doi":"10.48550/arxiv.2503.19325","metadata_source":"pith","pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","venue":"cs.CV","work_id":"9700bbdc-df42-461a-81fa-b29ffe683326","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:c659f2643879160c9cf9126c6de00ee445e7b5ef08e9cb58a2025862cdd9f3c6","observation_id":"38fa18db-11b1-4c5f-aad9-934815fd949d","resolution":{"observed_at":"2026-06-28T19:22:35.142836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00337","last_updated":"2025-05-01T06:34:55Z","snapshot_observed_at":"2026-07-06T21:17:28.488862Z","submitted_at":"2025-05-01T06:34:55Z","title":"T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2505.00337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00337","snapshot_observed_at":"2026-07-04T13:59:51.792842Z","title":"T 2 V P hys B ench: A first-principles benchmark for physical consistency in text-to-video generation","venue":null,"work_id":"8e0819a9-997f-40ad-9d64-220808cd9d4c","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2505.00337","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:48c4b6b6436af3a38744b2105c5d082d38fabbecd88df36d707af37eddde48f5","observation_id":"fc290460-3cc0-4b3e-ac19-f4548e4b75d2","resolution":{"observed_at":"2026-06-28T19:22:35.134374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:7fd43c7bf62c79201311cac30fec7b487bfffb7caf86864aa7b6332ce8568b00","observation_id":"09061cf4-72c1-401e-946d-cade91cb4cfe","resolution":{"observed_at":"2026-06-28T19:22:35.191867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Recurrent world models facilitate policy evolution.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:729110b85113e892f150449781faf3f1a7bb079c0f09018dbf200eed8959b675","observation_id":"764769eb-340f-4b94-808b-d1b2007f7bfd","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":"2301.04104","doi":"10.1126/sciadv.adu2488","metadata_source":"pith","pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Diverse Domains through World Models","venue":"cs.AI","work_id":"6aeb260f-8c7c-4f9c-b98b-067cd7c59acd","year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:d9471e14978b0f7be91e6ffa151ca926f17ccc724b0ce04538db24d63628c5cc","observation_id":"83e6f961-3392-4b7d-91c1-8770fc42e248","resolution":{"observed_at":"2026-06-28T19:22:35.084706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Video-bench: Human-aligned video generation benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:42208f171a48d6c10f73562bc030b880b3b9fe1250da60cba7d3591271960a55","observation_id":"8c24f42d-eb75-46ba-9a42-ae4f45f2ff5e","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13009","last_updated":"2026-04-07T11:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T15:28:53Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","version":4},"cited_work":{"arxiv_id":"2508.13009","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.13009","snapshot_observed_at":"2026-07-09T07:56:04.730683Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","venue":"cs.CV","work_id":"492a2d34-e672-45fb-8f54-c720d2dfae5a","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2508.13009","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:5101d606d01f51cb786f428b0eb32a30908df8bd3f302f48d78e73551b5eadec","observation_id":"41af21c2-018f-4cb7-b79b-b9c0443d7f31","resolution":{"observed_at":"2026-06-28T19:22:35.118293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Streamingt2v: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:a8a174fdd824b3a7954d358cfc5f896f2b8432ec2c53e7e252d587589e43c000","observation_id":"0c9c9042-5fb7-478b-b0d7-e3bf63784b5b","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advancesin neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:e295307b26e6d2fc1bf862aabe4174e71f4dd439365475f648abaf420a0f824e","observation_id":"43d98785-7df8-4d6d-acef-ee284e7debaf","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:d7df1fc81641020ee07999916ed6b78194056981ee6a1bd83f01e7aa77cc0fdb","observation_id":"b66a9f7b-2952-4be3-b6c6-f1e680fd9a49","resolution":{"observed_at":"2026-06-28T19:22:35.174312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Video diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:c96afc5864fd2da810569938577682a16e3d00bc307f1c73f60638c478fbf92a","observation_id":"9a7eea10-f7d4-40bf-9748-d549ad06834b","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Gaia-1: A generative world model for autonomous driving, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:6603a995ddd73d6a940ceb775547edddca53b80cdff7b5ad6b2847910d813301","observation_id":"9a996e82-2f43-4fa0-897d-e79b1de8188f","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:f7e20a98ae4787b94371f9b959d09bf057fa8789422e30461496cfcfa4ef594f","observation_id":"e2c9c63c-bce7-49cc-a03a-cd830eefdff6","resolution":{"observed_at":"2026-06-28T19:22:35.181671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"VBench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:62c45f4a171c9eff3be901cea92b6ffecc485a8997c2fb12240e5fa51821e74b","observation_id":"669241d5-c5ba-4586-85f7-5a9d4550914c","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"VBench++: Comprehensive and versatile benchmark suite for video generative models.IEEE Transactionson Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:3d31ac081dc48866a65540a6798495e227eafbfed71244f0b9674e39fc34c16e","observation_id":"606c04e7-ad21-4544-9efe-fa22c5f4352d","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Hy-world 1.5: A systematic framework for interactive world modeling with real-time latency and geometric consistency.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:ab9a2f30227993d3719ecbe1f93bdb19fa56a29123c5a5a81991228f6efa0ee5","observation_id":"f8c2e3b4-5d8c-45bb-8f15-ce4dc0bce61a","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Openclip.Zenodo, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:decec6a7647c7e411de718692d05b89f698dc1e9f766939477e95d068308bcf2","observation_id":"dd945270-0c51-474a-b372-fcfdf49e526c","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"T2vbench: Benchmarking temporal dynamics for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:ea62e54210b04a68ca2bec867cbcb8e3dcd506feb29575d31cbeb91611d7dbb9","observation_id":"1089c305-d6d6-4d29-9c1d-3ecb1328a8a3","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.14699","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T22:39:00.980432Z","title":"Memflow: Flowing adaptive memory for consistent and efficient long video narratives","venue":null,"work_id":"e31a9aca-409e-4ac5-8e91-3bb188e52cd0","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:88949223261ca65ccb69e21cd89da223afb754c9bc5f4d0837bd818840617f65","observation_id":"da1cfd43-2976-450c-b00f-6d8ceb25b45d","resolution":{"observed_at":"2026-06-28T19:22:35.162161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.05954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:07:43.037042Z","title":"Pyramidal flow matching for efficient video generative modeling.arXiv preprint arXiv:2410.05954","venue":null,"work_id":"86ba3b09-fc7d-4d26-acce-10677e0b5d69","year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:e919dac4f11f273fbb4a6f2d9440c07021e8b2b737b69775c77d89fe007fb33a","observation_id":"8c90ed9c-56a3-44d3-a344-4c72359bda0e","resolution":{"observed_at":"2026-06-28T19:22:35.155508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Fifo-diffusion: Generating infinite videos from text without training.Advancesin Neural Information Processing Systems, 37:89834–89868, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:0b607e4c740c3e4ebbff3b31c35626cd79bbb4d8b30a17a08bf352ae44dc530d","observation_id":"1e9ddf07-25a9-41ef-a262-7a384c3baaba","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Tanks and temples: Benchmarking large-scale scene reconstruction","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:25b8de5f5ad2e263de1300c9766f076ebc0a53f08cb95a2252cafb0cc5777d87","observation_id":"91620372-dfdc-4fda-afd3-4bcc5bf479bd","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:1790490cad1d79041af053ee8e375602c827b1d261882a5c67f84988ebf611c5","observation_id":"a191da2c-078e-47ee-9fc3-e168d586d647","resolution":{"observed_at":"2026-06-28T19:22:35.169682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Gonzalez, Ion Stoica, Song Han, and Yao Lu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:1d7d8dba59c0c5d1377ad62b77a6c39c2402d09b8be0209e63e3628df210ab11","observation_id":"8de8deec-bb39-4177-84c5-e71291cd3ad6","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00115","last_updated":"2025-01-04T06:16:56Z","snapshot_observed_at":"2026-07-06T19:59:11.046948Z","submitted_at":"2024-11-28T07:01:06Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","version":3},"cited_work":{"arxiv_id":"2412.00115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00115","snapshot_observed_at":"2026-07-04T10:09:44.579833Z","title":"Openhumanvid: A large-scale high-quality dataset for enhancing human-centric video generation","venue":null,"work_id":"8e193be1-fb2e-45f5-9b0c-01e3bd7a47f4","year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2412.00115","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:6ab3ff822345182570497b3c00a72b2351818e5c638d64e78976fc93106493f9","observation_id":"a360f3ab-e8d4-4a1f-beb7-0de58ec56bc2","resolution":{"observed_at":"2026-06-28T19:22:35.174977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2508.05635","doi":"10.48550/arxiv.2508.05635","metadata_source":"pith","pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","venue":"cs.RO","work_id":"440ad435-44ba-4acd-9aeb-21dd3ee04835","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:4ce075f3d2edd4898f85cad61550f30dd401c10088e0721f8e60ef27ccf9e934","observation_id":"d6f2e002-cc34-418e-98b0-887ca4534632","resolution":{"observed_at":"2026-06-28T19:22:35.191121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":"2511.10647","doi":"10.48550/arxiv.2511.10647","metadata_source":"pith","pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","venue":"cs.CV","work_id":"0a54b500-1e9d-46c2-85eb-8e16cbac8461","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:096021f7df8bafd390078badfaa6e92fc6e9ac4c91c0c01a25f03915d0958220","observation_id":"a3496d47-9283-499d-ac68-1053101e5008","resolution":{"observed_at":"2026-06-28T19:22:35.184272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:babf57f0a4241a886f813eee8d40cf0615a5f616d68b1440c6d23a64742e946f","observation_id":"ba7c79e8-aebc-4bd4-b86c-7a4fae9883c1","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:1dd33d90489e9fe375025788c9e9eca21b3658d7fd643d0208c4ef6fcdd50347","observation_id":"bb850652-8307-4b74-9fa8-5d2751189378","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":"2402.17177","doi":"10.48550/arxiv.2402.17177","metadata_source":"pith","pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","venue":"cs.CV","work_id":"49aeafea-5763-4b8e-aff4-8fa617aacb1f","year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:29446bfaf5028c4a7f9fb7026aaf89eea12bd1cc8fa030b65e594c9ed36cbbce","observation_id":"3f3362f9-8e0f-4e4c-a47f-edf54e66a604","resolution":{"observed_at":"2026-06-28T19:22:35.120276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Fetv: A benchmark for fine-grained evaluation of open-domain text-to-video generation.Advancesin Neural Information Processing Systems, 36:62352–62387, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:cc686c6b79f32297c88100a1ba63b913fa4a07d9933753237f5b493abcb9782d","observation_id":"a17cf3e6-dbba-40c9-88e9-15211af52095","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Out of sight, out of mind? evaluating state evolution in video world models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:9dd06a396ebecd58869d51f93aaf2fc62e2d8258b400632df55bb88f2a4c3027","observation_id":"0a054d5f-7fd2-4718-a358-6e0370d23062","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.22096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.240397Z","title":"Yume-1.5: A text-controlled interactive world generation model.arXiv preprint arXiv:2512.22096","venue":null,"work_id":"ad52c05d-d5a2-4898-a706-6e9f58dd3cf3","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:7d1f36d888febb894af3ad10367f6484aa4e9119606a06665a9301e4523ea077","observation_id":"70bfef34-4972-4621-a4c7-ea80756d8813","resolution":{"observed_at":"2026-06-28T19:22:35.143652Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17744","last_updated":"2025-07-23T17:57:09Z","snapshot_observed_at":"2026-08-01T22:55:14.174313Z","submitted_at":"2025-07-23T17:57:09Z","title":"Yume: An Interactive World Generation Model","version":1},"cited_work":{"arxiv_id":"2507.17744","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.17744","snapshot_observed_at":"2026-07-08T10:54:49.210345Z","title":"Yume: An interactive world generation model","venue":"cs.CV","work_id":"15c931d5-49da-401c-8c91-5b0de83195de","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2507.17744","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:4bfc8518cfea734ea4a389d91684025671a1e6d59a6d976f01ce330fc19d39c2","observation_id":"de6011d9-542d-4cab-9555-71330b6bde08","resolution":{"observed_at":"2026-06-28T19:22:35.161751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":"2410.05363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-07-08T07:14:45.198485Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","venue":"cs.CV","work_id":"644e2886-7387-436d-ac11-d848af5fcc71","year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:4363ae3e28074bf73bb57060c7224f8351f404d1d5a128f75b0630160b0b5617","observation_id":"75d96a76-7321-439e-b54e-68a7a75b22a0","resolution":{"observed_at":"2026-06-28T19:22:35.182074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00588","last_updated":"2023-03-01T09:21:14Z","snapshot_observed_at":"2026-07-06T13:47:58.509110Z","submitted_at":"2022-09-01T17:03:07Z","title":"Transformers are Sample-Efficient World Models","version":2},"cited_work":{"arxiv_id":"2209.00588","doi":"10.48550/arxiv.2209.00588","metadata_source":"arxiv_reference","pith_arxiv_id":"2209.00588","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transform- ers are sample-efficient world models.arXiv preprint arXiv:2209.00588","venue":"arXiv (Cornell University)","work_id":"388af2ed-cc43-48cc-92be-9fba2c20d9e3","year":2022},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2209.00588","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:d222a25c5662c7cc8a3661cd339c074619e2098bf6e1073fa8eae18e627980d5","observation_id":"d711bbb5-370d-4bdd-a173-52ac616c4363","resolution":{"observed_at":"2026-06-28T19:22:35.159472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Sora2.https://openai.com/zh-Hans-CN/index/sora-2/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:88ba5f400391906e3b24cdf8a458f56c734ec125aa04c4e98e1b2344f0c94099","observation_id":"22d4fa73-7cf4-4e23-ba2c-85e9da63c1dd","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:80eb8a27f2c1acdf4286270991e13e98ef164cc03b999e779e70de71d73f2a45","observation_id":"f4daa6cf-2470-4db6-99c2-c99c8a4814ec","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:bf97bc8d8cf9b2e4878501aae327cb53f83559e5ffb07dda2d701a03b1b36f6c","observation_id":"9839d058-e001-40c9-a8fd-7a98adc93fbf","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15169","last_updated":"2024-01-30T16:44:20Z","snapshot_observed_at":"2026-08-03T19:40:46.693368Z","submitted_at":"2023-10-23T17:59:58Z","title":"FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling","version":3},"cited_work":{"arxiv_id":"2310.15169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.15169","snapshot_observed_at":"2026-07-10T01:46:41.165409Z","title":"Freenoise: Tuning-free longer video diffusion via noise rescheduling.arXiv preprint arXiv:2310.15169","venue":"cs.CV","work_id":"772f3c4a-a84d-4ec2-9735-7d4cda51575c","year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2310.15169","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:749c430ad6c2ed42034e13afb7caae2a12c0ee8a91234bef859bfe631046cb89","observation_id":"bf1d6a3e-859c-4098-95dd-8d9b78a35af3","resolution":{"observed_at":"2026-06-28T19:22:35.136808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:76cd39467d22ed2aac6c57189e8b1d6a52fd0911887f52ac6920e0b302842f13","observation_id":"7ba08a8b-85a5-449c-a962-08722445bf96","resolution":{"observed_at":"2026-06-28T19:22:35.156713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Improved techniques for training gans.Advancesin neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:09563862f10b9efbfedd0b495aaa543bd721ff506af7fd023a235c42b97bcd54","observation_id":"d35cf775-3a33-4231-870a-7538a3cf4c37","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:af5ac988e64254eca857104d51814fad1719455cc0c318c3be13b0efb515392e","observation_id":"62c1d652-7efc-4a67-bd4b-d2758edcffe3","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":"2209.14792","doi":"10.48550/arxiv.2209.14792","metadata_source":"pith","pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","venue":"cs.CV","work_id":"52a801fc-a707-45a1-a8cd-0d6702f124ab","year":2022},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:0c3b6d88b70b321fa3a8ef59195a66211c5c5cd7666a7a391b3242807fdda702","observation_id":"4cd2b49b-d99d-4d2b-b307-bec094267bdd","resolution":{"observed_at":"2026-06-28T19:22:35.115850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Matrix-game 3.0: Real-time and streaming interactive world model with long-horizon memory","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:29134116be9f14630537511f3de287efa65787947622616fa674016d320682ea","observation_id":"1c4a48fa-fa2c-42e8-997c-7dcc4ca23b62","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"cited_work":{"arxiv_id":"2502.06764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06764","snapshot_observed_at":"2026-07-08T03:24:28.724863Z","title":"History-Guided Video Diffusion","venue":"cs.LG","work_id":"7822dfb2-a168-4080-8673-2dfafbe1a2ab","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2502.06764","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:ab98b01000d3c4690c2b88b63782ec54ba0ec07e2bd7bfd9980b1081e52da844","observation_id":"00240fd7-57a3-4379-ae0f-fe9cce3d13cc","resolution":{"observed_at":"2026-06-28T19:22:35.125350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"T2v-compbench: A comprehensive benchmark for compositional text-to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:2227c78e7421b63ccd38c90c9e3fc1d9bb430d7456fccbb52a0f77faef51ac83","observation_id":"6d00d965-cec9-4291-b05f-e1d6653e44a2","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Longcat-video technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:50dd6013255778f8f9e4e870d30bd948b5899dd4d9dea8e3297a3677f8d40df2","observation_id":"55a91075-c61b-4823-83ab-861c7a1d21cb","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-03T01:29:14.204066Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"cited_work":{"arxiv_id":"2601.20540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.20540","snapshot_observed_at":"2026-07-10T08:36:59.816756Z","title":"Advancing Open-source World Models","venue":"cs.CV","work_id":"3446760e-6460-429e-82f6-6a5133ce4c8a","year":2026},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2601.20540","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:1ef3cee434febc14b48d52cc3cfdb87f1636e7622a3bab202bc028e55b012b93","observation_id":"63e186c1-0317-4c65-827b-426b9de957c0","resolution":{"observed_at":"2026-06-28T19:22:35.172016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Mocogan: Decomposing motion and content for video generation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:0c4b888488951f3fc5541a4d6c39aa13ed16f86c55f006998ee9455f11e5eedc","observation_id":"587808fa-ae8d-4071-a8d3-aea3e12bef02","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"UniFOLM-WMA-0: A world-model-action (wma) framework under UniFOLM family, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:11e9303319b767b8dbfef061400ed7ea9782f34c008d1f50dd446e716d686194","observation_id":"f1264607-66fa-4fbc-aa1a-1ed2c39b24a0","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":"1812.01717","doi":"10.48550/arxiv.1812.01717","metadata_source":"pith","pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","venue":"cs.CV","work_id":"72f42543-17d5-49aa-ba5a-25d67ffbb88a","year":2018},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:200b719e38ccd0a1774be6172a41d58613f4bb6b2b08c361166bed8891d2ad59","observation_id":"18df11a5-8698-469f-ae9d-039594313bad","resolution":{"observed_at":"2026-06-28T19:22:35.176706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"How close are world models to the physical world?arXiv preprint arXiv:2501.xxxxx, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:29799b519a34b40a0cacf5983c2873d96165dd56bb805a0932b2cf3cb88cf5e6","observation_id":"080dd672-301c-432c-beff-fb72cba38d53","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02399","last_updated":"2022-10-05T17:18:28Z","snapshot_observed_at":"2026-08-04T09:09:48.463217Z","submitted_at":"2022-10-05T17:18:28Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","version":1},"cited_work":{"arxiv_id":"2210.02399","doi":"10.48550/arxiv.2210.02399","metadata_source":"pith","pith_arxiv_id":"2210.02399","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","venue":"cs.CV","work_id":"a325cd53-6549-4726-b3e9-94509f0df168","year":2022},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2210.02399","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:628164ae18cd0cad390caf10c4d54850c224caaa6c1877a8f8c286afbfc04d1c","observation_id":"946167d5-d460-4ba5-ab16-6331f16e8872","resolution":{"observed_at":"2026-06-28T19:22:35.046561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Generating videos with scene dynamics.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:33606df54eb1194db04d58f1d7956cf7ee89386822d9bedae61a7400ac029e62","observation_id":"8dbc399c-0761-46ee-a89a-69b611b86003","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:676c2404573def6cd321e44eb747c7de11a145360b4a214f61f87e5b136205c6","observation_id":"5325b6c0-740c-4b8a-9831-3ebdedc48950","resolution":{"observed_at":"2026-06-28T19:22:35.169842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-07-06T15:34:51.593721Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:4f75041136a24288a2fd33bc618b8207b65a4b44795c3301310e6a717b6238ff","observation_id":"3e2224ea-c61a-490d-88c8-980f2bb8fb53","resolution":{"observed_at":"2026-06-28T19:22:35.077252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.09676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:56:04.737468Z","title":"Spatialvid: A large-scale video dataset with spatial annotations.arXiv preprint arXiv:2509.09676, 2025a","venue":null,"work_id":"fa42660a-b999-4c7f-80c9-2b72151c3399","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:5005a138d4b598a3f2300cf134d394d905da21d4bb69420e8f87d117ed22872b","observation_id":"0c04f754-c2c4-49d2-9fbb-b7f5a5cc91d2","resolution":{"observed_at":"2026-06-28T19:22:35.140390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09777","last_updated":"2023-11-27T05:09:29Z","snapshot_observed_at":"2026-07-06T16:19:57.322692Z","submitted_at":"2023-09-18T13:58:42Z","title":"DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2309.09777","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.09777","snapshot_observed_at":"2026-07-08T20:15:34.250670Z","title":"Drivedreamer: Towards real-world-driven world models for autonomous driving","venue":"cs.CV","work_id":"6f9360bd-694b-4627-8071-516c65e6696a","year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2309.09777","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:05a3845ec25c3b168f1b03fe46a513994da85f2deae42a6ef52236dd03214ec3","observation_id":"24f75957-786b-4dfe-93ef-5129a7a5472c","resolution":{"observed_at":"2026-06-28T19:22:35.117848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08995","last_updated":"2026-04-13T03:48:38Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:00:09Z","title":"Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory","version":2},"cited_work":{"arxiv_id":"2604.08995","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08995","snapshot_observed_at":"2026-07-09T07:56:04.713905Z","title":"Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory","venue":"cs.CV","work_id":"03ae1098-067d-4fea-90da-4ace0a031a03","year":2026},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2604.08995","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:a3c579999748413703c647340ae66fbdcaa7377348ce9f99d29779ea4c8ca1da","observation_id":"58f0d558-e674-41c1-b0fd-59594131ca80","resolution":{"observed_at":"2026-06-28T19:22:35.065286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-07-06T11:05:04.853545Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":"2104.14806","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-07-02T00:56:24.869825Z","title":"Godiva: Generating open-domain videos from natural descriptions","venue":null,"work_id":"6f53148b-2cd8-4a9b-9fc5-bfec20977e90","year":2021},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:3b8c967beb3249136b7dc59e333989c00aaf5fb093f95c2ebf188a5b162457df","observation_id":"6e2c0d80-0a6c-4434-8fa2-75abfb114abe","resolution":{"observed_at":"2026-06-28T19:22:35.179257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:58:58.309875Z","title":"Omni-WorldBench: Towards a comprehensive interaction-centric evaluation for world models.arXiv preprint arXiv:2603.22212, 2026","venue":null,"work_id":"498d5ed1-06f0-43d2-974f-8185a180e655","year":2026},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:236b00f6e5137e4a9f3526570742b31cb9090979b7377880c44ecbf5005c8a77","observation_id":"219bff66-5671-45f5-b59f-eddbdef9677b","resolution":{"observed_at":"2026-06-28T19:22:35.196990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T10:54:49.220855Z","title":"Infinite-World: Scaling interactive world models to 1000-frame horizons via pose-free hierarchical memory","venue":null,"work_id":"c6bda419-e0dc-45aa-b96b-eef3a31d0930","year":2026},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:1aac70ddeaa35114d2c2875451b7c2c9f2d1432e6a23f00454c16a2cabf62bd3","observation_id":"593a04dc-d92c-487a-9099-3a322d71a3d9","resolution":{"observed_at":"2026-06-28T19:22:35.184436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.12369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:19:13.356094Z","title":"arXiv preprint arXiv:2504.12369 , year=","venue":null,"work_id":"7159175f-77a7-43d9-8dc3-54bda91b0e0b","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:5995734421e82d2b835bd3259b66bc2747b4b703171d26eab7b73552ad71f512","observation_id":"bac2e25f-0ffe-4d7f-8264-4068164159a7","resolution":{"observed_at":"2026-06-28T19:22:35.079970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.21686","last_updated":"2026-04-23T13:50:47Z","snapshot_observed_at":"2026-07-06T23:08:14.631453Z","submitted_at":"2026-04-23T13:50:47Z","title":"WorldMark: A Unified Benchmark Suite for Interactive Video World Models","version":1},"cited_work":{"arxiv_id":"2604.21686","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.21686","snapshot_observed_at":"2026-07-08T07:14:45.311187Z","title":"WorldMark: A Unified Benchmark Suite for Interactive Video World Models","venue":"cs.CV","work_id":"078f612b-8ae1-4007-9a01-1e84261dd9fb","year":2026},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2604.21686","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:77aa27c83466feae97adb0e25ba1b21420e56d02ae889b41c49ea1c4c809bb91","observation_id":"ba32537c-dce8-4497-acb5-c23187971e83","resolution":{"observed_at":"2026-06-28T19:22:35.145661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":"2104.10157","doi":"10.48550/arxiv.2104.10157","metadata_source":"pith","pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","venue":"cs.CV","work_id":"703c74c3-fa5e-455c-8c00-697c83511fcf","year":2021},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:7b6423e8d3efd241ac6cf5fc231d7848351f2f8c47b0a1f7829b054cf68de54e","observation_id":"03bbca4f-6a72-43a4-bd42-0d171f8181fd","resolution":{"observed_at":"2026-06-28T19:22:35.152501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":"2310.06114","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-07-04T17:09:59.117795Z","title":"Learning Interactive Real-World Simulators","venue":"cs.AI","work_id":"16f38691-7ab6-4e23-bba5-6b656579e579","year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:f746470ca05e41679483a8b7eb86ef0a676a054830a777131f2d2152a1005bf7","observation_id":"b5e95b31-779b-44b3-8f37-832344776485","resolution":{"observed_at":"2026-06-28T19:22:35.079542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Longlive: Real-time interactive long video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:e8d6b836b17bc52da84aea7f78bc7c34cbb1e333e14d12ec5762c7c961e0fbca","observation_id":"63c32d4d-a49e-46bc-a541-9aa5de1f03bd","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:c716268342903b6ff72c95285c1ce5655d741e86224ba2858978dd6f6a0ec486","observation_id":"14c646c6-285b-4e6b-8955-8d5684e6a612","resolution":{"observed_at":"2026-06-28T19:22:35.194339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Yan: Foundational interactive video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:90a460f7eae6d2d5ff29df21189e1b9e3f48249f7ec3e2fec05d18501985d383","observation_id":"e33b51ff-059e-45b9-8a74-dd3809420bc0","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Mind: Benchmarking memory consistency and action control in world models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:ebbbe632852445c85e08b818aa09d12823d636ace2d2452712ebe0469a381514","observation_id":"3d2eb81f-c57c-4451-be05-7da8abd9cdfc","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.20649","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:59:07.583971Z","title":"Infinity-RoPE: Action-controllable infinite video generation emerges from autoregressive self- rollout","venue":null,"work_id":"bf98ead3-5902-4e92-9114-acd0c26e93c5","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:4170a926ab147c98511c649d37a0b00ae1963926fe4d61ce6368360b28c913fa","observation_id":"d47625e7-5a5e-4634-a605-177a2d0549ea","resolution":{"observed_at":"2026-06-28T19:22:35.167229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Nuwa-xl: Diffusion over diffusion for extremely long video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:580f188698bf684d0483d266a06fde61247b1b8bb9fb424053ed06594289a090","observation_id":"93333b36-21f1-4840-8716-1ab11677e31c","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:23414d1d21940ca4ca7bdd5abf48392c6628223fb7bd816252e8b4f8d7311520","observation_id":"f99d5eb1-efaa-4e26-addf-cef51050d486","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Chronomagic-bench: A benchmark for metamorphic evaluation of text-to-time-lapse video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:af54b2976292221ee6f5642a8a5ad99f04e72e189504d218c7fece65ca9c739b","observation_id":"811b914f-efc3-4dc9-b2d4-a68e2f82d472","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.04379","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.244905Z","title":"Improved distribution matching distillation for fast image synthesis.Advances in neural information processing systems, 37:47455–47487, 2024a","venue":null,"work_id":"005eb8db-424f-4973-a65a-d7f9c23eac02","year":2026},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:64ba0379156f23bcedf334393a72ac2bdbdf4a403578521d34a04b1fe03cd121","observation_id":"3d8681f0-17d0-43f5-af2f-3cb9ea5aac46","resolution":{"observed_at":"2026-06-28T19:22:35.164500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"Packing input frame context in next-frame prediction models for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:85a972b150d755c689b5508c3dd98f92c90fee98906959ab3ae06d867cf3fbad","observation_id":"6c3134f0-8a4e-45be-a330-8cc504dc63b1","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:04:58.672464Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:77d756f5de2246a8303ac057795c99cabebc243495c3b7e4b99d3d3b3840d69c","observation_id":"4f87a064-6d35-4cfc-b1b4-9456da40bfc9","resolution":{"observed_at":"2026-06-28T19:04:58.672464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:cc112e798df9c1d101e875dd5fa1e6a315fd91ba40799aafabec326a56ee8b21","observation_id":"f39305a2-4a6b-41ef-ad91-b22585cceff1","resolution":{"observed_at":"2026-06-28T19:22:35.113216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26412","last_updated":"2026-05-28T07:53:49Z","snapshot_observed_at":"2026-08-04T08:51:01.436798Z","submitted_at":"2025-10-30T12:00:46Z","title":"LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2510.26412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.26412","snapshot_observed_at":"2026-06-28T19:22:35.149980Z","title":"Locot2v-bench: Benchmarking long-form and complex text-to-video generation","venue":"cs.CV","work_id":"e499c4c0-0d9f-4a23-acfd-c3a87b928634","year":2025},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2510.26412","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:1d23bcd13b64f82c2cd1cc55f40ba0cd006bdf56f2d1296e996220d2419051b2","observation_id":"3e601acf-e865-4f6b-8696-b9a30703d0a6","resolution":{"observed_at":"2026-06-28T19:22:35.151377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"cited_work":{"arxiv_id":"2602.02214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.02214","snapshot_observed_at":"2026-07-10T13:47:05.847304Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","venue":"cs.CV","work_id":"04f67f5b-e79a-4ad9-8e90-763e5e54bd3d","year":2026},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2602.02214","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:a65a0582e011ec96801df87f14a48acf0a2fe30ed7144de12b951a8ad512e126","observation_id":"4eb2d6c1-03ef-4251-88a7-152c73e06aed","resolution":{"observed_at":"2026-06-28T19:22:35.177383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":50,"verified_exact":48,"verified_fuzzy":0},"total_outbound_references":101},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 101 outbound references and 4 inbound Pith citation observations for arXiv:2606.00793."}