{"as_of":"2026-08-18T08:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f348a52c380e6c57858b225cb063df98cdc66b0fb80e674bd690fbee34d1ae69","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:28:43.713731Z","state":"measured"},{"denominator":135,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":135,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":44,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T05:06:52.002085Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:58:47.769652Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-14T21:13:23.101760Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-19T05:13:28.767788Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2507.07982"},"observation_digest":"sha256:3f9e59c57852f48c72c4d04bd194627a34b31ab1059060ee501167c327a5112d","observation_id":"ee0a90ed-2aea-40b7-8c77-4888a76cc81e","resolution":{"observed_at":"2026-05-19T05:17:06.641553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-08-06T12:26:02.233410Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21809","last_updated":"2025-08-13T09:21:11Z","snapshot_observed_at":"2026-08-17T08:17:29.865586Z","submitted_at":"2025-07-29T13:43:35Z","title":"HunyuanWorld 1.0: Generating Immersive, Explorable, and Interactive 3D Worlds from Words or Pixels","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:02.233410Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2507.21809"},"observation_digest":"sha256:255cf885d01a280c43ad98b841057677c21665826e8b155c130fc9caab6574b3","observation_id":"636d5055-d7e8-4139-831c-824b9ece7313","resolution":{"observed_at":"2026-08-06T12:26:02.233410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-08-04T09:12:52.398588Z","title":"Video world models with long-term spatial memory,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.16732","last_updated":"2026-06-25T19:54:02Z","snapshot_observed_at":"2026-08-12T21:04:24.441891Z","submitted_at":"2025-10-19T07:12:32Z","title":"A Comprehensive Survey on World Models for Embodied AI","version":3},"reference_index":199,"source":"pdf_text","source_observed_at":"2026-08-04T09:12:52.398588Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2510.16732"},"observation_digest":"sha256:a395df5c69daf962d36b9b38849f75438a11d41415d6f3eeaad8fe354db57d57","observation_id":"f8fc7f98-e26c-420f-a05c-aaef4d954313","resolution":{"observed_at":"2026-08-04T09:12:52.398588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-08-03T20:15:35.555180Z","title":"Video world models with long-term spatial memory.arXiv preprint arXiv:2506.05284,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20644","last_updated":"2026-07-09T17:59:10Z","snapshot_observed_at":"2026-08-16T04:36:40.548554Z","submitted_at":"2025-11-25T18:59:02Z","title":"Vision-Language Memory for Spatial Reasoning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:35.555180Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2511.20644"},"observation_digest":"sha256:a3724a030aca6110d962c7514f29ed01f0d2ffd35c462ed2a6bf12f6ccba51a5","observation_id":"37b91f7c-f361-43ea-a426-47bd596a521e","resolution":{"observed_at":"2026-08-03T20:15:35.555180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-08-03T15:28:59.391766Z","title":"Video world models with long-term spatial memory.arXiv preprint arXiv:2506.05284, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.17796","last_updated":"2026-06-24T08:52:20Z","snapshot_observed_at":"2026-08-13T02:26:05.415227Z","submitted_at":"2025-12-18T18:59:18Z","title":"CustomX: Unified Character, Action, and Scene Customization in Video World Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T15:28:59.391766Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2512.17796"},"observation_digest":"sha256:4d434abf747f77f71ff174cebad3b551a8d8af77b5909e98f20b5dd77471942d","observation_id":"b8eccc32-8483-4338-8c3c-db7b1b221618","resolution":{"observed_at":"2026-08-03T15:28:59.391766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-08-03T13:00:58.581479Z","title":"Video world models with long-term spatial memory, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01075","last_updated":"2026-05-28T18:42:26Z","snapshot_observed_at":"2026-08-16T17:25:53.373225Z","submitted_at":"2026-01-03T05:22:27Z","title":"Flow Equivariant World Models: Memory for Partially Observed Dynamic Environments","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-03T13:00:58.581479Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2601.01075"},"observation_digest":"sha256:67f125d4436842e3b846e81880a1f2815f171e665d1c71622208b754724acc90","observation_id":"087dab1d-de5d-4e2e-aded-3bed54e9764c","resolution":{"observed_at":"2026-08-03T13:00:58.581479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-08-02T20:36:13.618901Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22960","last_updated":"2026-06-29T11:22:33Z","snapshot_observed_at":"2026-08-14T12:23:22.280746Z","submitted_at":"2026-02-26T12:54:46Z","title":"UCM: Unified Modeling of Camera Control and Memory with Time-aware Positional Encoding Warping for World Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T20:36:13.618901Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2602.22960"},"observation_digest":"sha256:6ed06084f164b4c5d803ddc86315c8414183ef79052a3ff075d5edb85618cca8","observation_id":"c3b47843-bc56-4013-a2d5-3b793ce62624","resolution":{"observed_at":"2026-08-02T20:36:13.618901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-08-02T19:20:43.802270Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.02697","last_updated":"2026-06-03T03:49:31Z","snapshot_observed_at":"2026-08-13T23:32:18.514833Z","submitted_at":"2026-03-03T07:41:12Z","title":"ShareVerse: Multi-Agent Consistent Video Generation for Shared World Modeling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T19:20:43.802270Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2603.02697"},"observation_digest":"sha256:46076deaa5c4ede0bdb037ae316a21cd08625bf249b013d2ccdb03e75e890d5c","observation_id":"86818377-1329-423c-a336-62f3014d30fd","resolution":{"observed_at":"2026-08-02T19:20:43.802270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2603.11911","last_updated":"2026-05-06T13:54:46Z","snapshot_observed_at":"2026-08-16T00:03:57.202045Z","submitted_at":"2026-03-12T13:28:50Z","title":"InSpatio-WorldFM: An Open-Source Real-Time Generative Frame Model","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T12:07:17.341611Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2603.11911"},"observation_digest":"sha256:8b13b736db0a92883f3d9a0b16fe5accbdb8be42d53cdaad80569f8670138b94","observation_id":"b17f6513-766a-44e5-b364-811e2669f34e","resolution":{"observed_at":"2026-05-15T12:09:59.889971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-08-16T06:51:21.904839Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":288,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:0d6f620540fd03d501dc9897c25613eec54b7ce71c73dd889eece785e658b180","observation_id":"db841f41-b426-41cd-9d5c-fd3236bc35a8","resolution":{"observed_at":"2026-05-11T00:05:51.128062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2604.10578","last_updated":"2026-04-14T11:24:24Z","snapshot_observed_at":"2026-08-15T14:04:17.388220Z","submitted_at":"2026-04-12T10:55:14Z","title":"Rein3D: Reinforced 3D Indoor Scene Generation with Panoramic Video Diffusion Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:15.916685Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2604.10578"},"observation_digest":"sha256:f13c194d4b2cb2acbba7d5f4f50a4884c193ae9234702100c1fdce23b607fa52","observation_id":"b53b137b-73b7-49be-80bd-a27e65817c26","resolution":{"observed_at":"2026-05-11T10:16:05.837003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2604.13036","last_updated":"2026-04-14T17:59:44Z","snapshot_observed_at":"2026-08-11T10:46:08.311397Z","submitted_at":"2026-04-14T17:59:44Z","title":"Lyra 2.0: Explorable Generative 3D Worlds","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-05-10T15:30:57.712342Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2604.13036"},"observation_digest":"sha256:68ed43fce84c7756ac05cf39aafde8b80215852c479b278df0a9f3e50d92d56f","observation_id":"293929ef-d807-4f29-8824-378a0acf7c45","resolution":{"observed_at":"2026-05-11T10:25:59.826682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2604.13793","last_updated":"2026-07-01T12:10:20Z","snapshot_observed_at":"2026-08-13T13:28:39.975215Z","submitted_at":"2026-04-15T12:32:25Z","title":"From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:35.738229Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2604.13793"},"observation_digest":"sha256:174063a587c740e7bcbe19e2668885e643292d458b050bec8f8643624adb4b63","observation_id":"9f0559ff-fb52-45f3-b3ff-ccd4b89aff62","resolution":{"observed_at":"2026-05-10T13:25:26.109906Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-12T20:34:35.048469Z","title":"arXiv preprint arXiv:2506.05284 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13793","last_updated":"2026-07-01T12:10:20Z","snapshot_observed_at":"2026-08-13T13:28:39.975215Z","submitted_at":"2026-04-15T12:32:25Z","title":"From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T20:34:35.048469Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2604.13793"},"observation_digest":"sha256:779c360b77a371d578270949dd938404aedb99d602c56ae6cc1156564839ad48","observation_id":"2ab0e1d6-3ab7-4024-aa86-8a079fda0a66","resolution":{"observed_at":"2026-07-12T20:34:35.048469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-08-11T21:17:05.183857Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:92675c0df064a30fc5d518a90446171f9211ba30bfee16384dc55ade11369868","observation_id":"7a7fbba3-4c47-49af-93b7-033e624c2f1e","resolution":{"observed_at":"2026-05-10T10:09:08.116213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2604.19741","last_updated":"2026-06-03T18:09:47Z","snapshot_observed_at":"2026-08-12T19:41:37.821685Z","submitted_at":"2026-04-21T17:59:03Z","title":"CityRAG: Stepping Into a City via Spatially-Grounded Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:54.935053Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2604.19741"},"observation_digest":"sha256:6ec19ca754d261409c1dfe027b42d8b0e9abfff8bc6b9027c96bd49c11995bcb","observation_id":"7e3da4bb-7bcb-4ef9-a888-b499847b80d1","resolution":{"observed_at":"2026-05-11T13:11:25.889379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2604.24764","last_updated":"2026-05-26T15:39:12Z","snapshot_observed_at":"2026-08-13T05:38:25.154739Z","submitted_at":"2026-04-27T17:59:56Z","title":"World-R1: Reinforcing 3D Constraints for Text-to-Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T04:26:58.408225Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2604.24764"},"observation_digest":"sha256:397e3bf9b5fc926dd0577e8f34d42bc2ea55a1d7624b657e472754447eeac075","observation_id":"a9c1c1d7-7b99-46ac-89b8-1f6c545eb023","resolution":{"observed_at":"2026-05-11T21:46:38.112040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2604.24764","last_updated":"2026-05-26T15:39:12Z","snapshot_observed_at":"2026-08-13T05:38:25.154739Z","submitted_at":"2026-04-27T17:59:56Z","title":"World-R1: Reinforcing 3D Constraints for Text-to-Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T08:47:47.264480Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2604.24764"},"observation_digest":"sha256:86aa181eeba723a416ff8f6a58659f91240e9ff7326a538a4735eecd67c43932","observation_id":"5ae0bca7-9524-4a3b-b269-0d929b413b74","resolution":{"observed_at":"2026-05-21T08:49:53.597194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2604.24764","last_updated":"2026-05-26T15:39:12Z","snapshot_observed_at":"2026-08-13T05:38:25.154739Z","submitted_at":"2026-04-27T17:59:56Z","title":"World-R1: Reinforcing 3D Constraints for Text-to-Video Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T06:44:23.038517Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2604.24764"},"observation_digest":"sha256:8e0a6567469aa1dbb702b035f9c085419ececff81f569e3a4787736eee798b0b","observation_id":"0b4c3f49-2130-4177-8b59-5145aa87eea8","resolution":{"observed_at":"2026-05-25T06:45:25.816518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2605.01694","last_updated":"2026-05-03T03:19:42Z","snapshot_observed_at":"2026-08-14T20:59:13.844240Z","submitted_at":"2026-05-03T03:19:42Z","title":"Latent State Design for World Models under Sufficiency Constraints","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T15:55:31.825583Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2605.01694"},"observation_digest":"sha256:8ac6c512fb12c8690e6049c521b1b55505df2ca0545f2c1546f3950b3eb33ad7","observation_id":"497e5e4d-9604-4574-a84b-e92d64a81062","resolution":{"observed_at":"2026-05-11T09:36:04.520976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2605.09442","last_updated":"2026-05-10T09:37:56Z","snapshot_observed_at":"2026-08-16T07:20:54.593158Z","submitted_at":"2026-05-10T09:37:56Z","title":"SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T04:57:38.215348Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2605.09442"},"observation_digest":"sha256:b2781b6745b0e6d3d49fb8483a2226aba48c1c442eecebd1c73a4a5f1eb93c2c","observation_id":"caabfd76-5e59-474f-88be-df2628208b22","resolution":{"observed_at":"2026-05-12T05:46:30.406350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2605.15182","last_updated":"2026-05-14T17:58:26Z","snapshot_observed_at":"2026-08-12T18:18:25.219870Z","submitted_at":"2026-05-14T17:58:26Z","title":"Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T03:16:07.765247Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2605.15182"},"observation_digest":"sha256:a6d038ab9a278468fdffe06bdc7246a83c38295e6b806ad225435c0e4671b9de","observation_id":"0ea0c8ec-7d31-4e5c-9199-d47fd242540a","resolution":{"observed_at":"2026-05-15T03:19:43.849395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2605.18365","last_updated":"2026-05-18T13:17:08Z","snapshot_observed_at":"2026-08-16T04:30:50.057000Z","submitted_at":"2026-05-18T13:17:08Z","title":"GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-20T11:06:09.367559Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2605.18365"},"observation_digest":"sha256:ebb943637194c46fcbb01baca2f2f7c97829b05bbf3ea9a450d500e23aa644cc","observation_id":"80449b1e-5714-40b3-8b97-52e5afc20cf7","resolution":{"observed_at":"2026-05-20T11:08:13.549665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2605.22814","last_updated":"2026-05-21T17:58:06Z","snapshot_observed_at":"2026-08-13T11:19:21.635773Z","submitted_at":"2026-05-21T17:58:06Z","title":"Remember to be Curious: Episodic Context and Persistent Worlds for 3D Exploration","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-22T06:45:33.135713Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2605.22814"},"observation_digest":"sha256:9538bbf8d8b03127aba4cd5d8f692b41d1a88d92c3b896e176206f916084b6ac","observation_id":"3d08f979-f9d9-4b1c-b494-d9bc7c4483ee","resolution":{"observed_at":"2026-05-22T06:46:10.702631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2605.26316","last_updated":"2026-05-25T20:13:16Z","snapshot_observed_at":"2026-08-01T03:37:55.526828Z","submitted_at":"2026-05-25T20:13:16Z","title":"E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T22:24:38.389294Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2605.26316"},"observation_digest":"sha256:f6698b4c99916ef04d3c487786643038865fff06a7cbabb245968dd71eddff31","observation_id":"43529a1f-e41e-4287-b71c-95d7e23b4be1","resolution":{"observed_at":"2026-06-29T22:34:02.508995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2605.27589","last_updated":"2026-05-26T19:02:26Z","snapshot_observed_at":"2026-08-18T04:54:16.957812Z","submitted_at":"2026-05-26T19:02:26Z","title":"What-If World: A Causal Benchmark for General World Models in Embodied Scenarios","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:22.987086Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2605.27589"},"observation_digest":"sha256:a352cf7d2474d219530784f78e2892e2836fa3457ef2cc54920f545f11454d06","observation_id":"52cfe877-7da2-4a7f-9825-16c53dc2f7f2","resolution":{"observed_at":"2026-06-29T18:23:50.422893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2605.30855","last_updated":"2026-06-01T09:19:36Z","snapshot_observed_at":"2026-08-16T22:18:33.146183Z","submitted_at":"2026-05-29T05:21:33Z","title":"Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T22:56:35.530309Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2605.30855"},"observation_digest":"sha256:eb351c4835afebf7cc65779ec96017c17a11d90741222cdb38735c55baacce22","observation_id":"922e74e5-09ec-44e6-9686-847f40159c8b","resolution":{"observed_at":"2026-07-01T19:16:00.415735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2605.31336","last_updated":"2026-05-29T14:17:59Z","snapshot_observed_at":"2026-08-08T11:08:50.003696Z","submitted_at":"2026-05-29T14:17:59Z","title":"DecMem: Towards Minute-Long Consistent World Generation with Decoupled Memory","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T22:38:10.473453Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2605.31336"},"observation_digest":"sha256:944c198d604b519aa3a2110556e7747d3bed18e6f9d158cb88148f6795325f6c","observation_id":"f10097b2-981b-430b-a5bf-b36fce02d089","resolution":{"observed_at":"2026-06-28T22:42:46.802396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2606.02436","last_updated":"2026-06-01T16:08:43Z","snapshot_observed_at":"2026-08-16T01:32:07.802877Z","submitted_at":"2026-06-01T16:08:43Z","title":"Geometry-Aware Implicit Memory for Video World Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T15:27:55.009337Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2606.02436"},"observation_digest":"sha256:83b9adaa3bc548b0807700749bd4ec97f66324fa0374ef75136a68e3efcb2291","observation_id":"52e1ebb3-cb56-4643-9b9b-a37d3b567250","resolution":{"observed_at":"2026-07-01T22:26:16.916728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-16T00:06:16.567037Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:ef6dc1016abc23d03ecb1bcc777ca90676cf1ff2871a42a92705f020fa3ae4f4","observation_id":"15b1745a-4e0f-4613-b3e3-3a22ccec0846","resolution":{"observed_at":"2026-07-01T22:56:20.230079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2606.09803","last_updated":"2026-06-08T17:54:10Z","snapshot_observed_at":"2026-08-12T22:21:00.037802Z","submitted_at":"2026-06-08T17:54:10Z","title":"Echo-Memory: A Controlled Study of Memory in Action World Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T16:58:37.552036Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2606.09803"},"observation_digest":"sha256:97095d96256be7212873b17f7bef81acf778fcee1c940146e19270d080791952","observation_id":"d94f74c9-ad90-4347-9bc7-469fe39bc835","resolution":{"observed_at":"2026-07-03T00:57:29.674605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-08-14T17:26:29.934753Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:5309ec5ee7ed4c86a77596d43c586f5c68f097e9308547db1ee1d39731c8a925","observation_id":"28a335ba-f5e4-4223-a2fb-0c33e2a2d615","resolution":{"observed_at":"2026-07-03T01:07:30.600792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2606.10656","last_updated":"2026-06-09T10:04:38Z","snapshot_observed_at":"2026-08-16T03:11:14.812789Z","submitted_at":"2026-06-09T10:04:38Z","title":"Envision4D: Envisioning Visual Futures via Feed-forward 4D Gaussian Splatting for Autonomous Driving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T13:48:15.379724Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2606.10656"},"observation_digest":"sha256:d9fe6b204a74844ee7103b4f2595bd16a3d4d633ff0a56b0c119a6f2167cd6d7","observation_id":"9afb05e6-0393-4130-bfc4-23383c6a2c43","resolution":{"observed_at":"2026-07-03T04:37:36.928655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2606.11129","last_updated":"2026-06-23T05:28:32Z","snapshot_observed_at":"2026-08-14T19:43:16.696160Z","submitted_at":"2026-06-09T17:24:36Z","title":"WorldOlympiad: Can Your World Model Survive a Triathlon?","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T13:05:26.397711Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2606.11129"},"observation_digest":"sha256:b4641dd35b968c30f902dbcfd70da44c3626ed8117b79e41cff6cfd0d921953e","observation_id":"670b0a12-4994-45a9-80a7-f23cd4ca1f41","resolution":{"observed_at":"2026-07-03T05:47:41.312221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2606.16449","last_updated":"2026-06-16T02:33:07Z","snapshot_observed_at":"2026-08-17T01:09:27.291570Z","submitted_at":"2026-06-15T09:20:32Z","title":"PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T03:23:58.455778Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2606.16449"},"observation_digest":"sha256:a94fb8559a03eee04334611c0cac92f61fa5140370eeba048b1c1b58940e97c5","observation_id":"0e30d2f3-0821-4a88-b09d-7ac439255ac0","resolution":{"observed_at":"2026-07-03T17:58:47.771173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2606.27964","last_updated":"2026-06-26T11:08:09Z","snapshot_observed_at":"2026-08-08T15:58:26.026893Z","submitted_at":"2026-06-26T11:08:09Z","title":"Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-29T05:03:56.624536Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2606.27964"},"observation_digest":"sha256:dab1c7cdc22b482288f62cf77c75803b009b55f82fe0a740243b5104fed43d31","observation_id":"1a30d43d-6110-4c61-a366-58d5fe3a315e","resolution":{"observed_at":"2026-06-29T18:43:51.062094Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-08-07T09:44:34.339704Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:6c38d964184b82c363d3c811d5a6e24fe4c259123313c677c1671e0a55539025","observation_id":"e4e4f89e-2fa9-4b30-8169-d9633376bce8","resolution":{"observed_at":"2026-07-01T10:25:41.838697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2607.00832","last_updated":"2026-07-06T11:37:36Z","snapshot_observed_at":"2026-08-17T00:13:39.501110Z","submitted_at":"2026-07-01T11:54:02Z","title":"Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-02T13:52:00.598189Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2607.00832"},"observation_digest":"sha256:2884f933c85070feac234e0a426cc26dadb370b8f910dba0af0f300b6701a335","observation_id":"c7b926ee-a5e3-415c-b35a-b6ed1e0edff9","resolution":{"observed_at":"2026-07-02T13:56:59.195617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-12T09:15:55.868800Z","title":"Video world models with long-term spatial memory.arXiv preprint arXiv:2506.05284,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.00832","last_updated":"2026-07-06T11:37:36Z","snapshot_observed_at":"2026-08-17T00:13:39.501110Z","submitted_at":"2026-07-01T11:54:02Z","title":"Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T09:15:55.868800Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2607.00832"},"observation_digest":"sha256:7e9f77d7abb396e4a7ca4ddcdb8d99243c3a2c3da835ec2edea0930d55dfa56a","observation_id":"b00225a9-7fa8-4d5b-8236-e0d14d1fa078","resolution":{"observed_at":"2026-07-12T09:15:55.868800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2607.01202","last_updated":"2026-07-01T17:41:00Z","snapshot_observed_at":"2026-08-02T00:15:40.296985Z","submitted_at":"2026-07-01T17:41:00Z","title":"World from Motion: Generative Dynamic Gaussian Reconstruction from Monocular Video","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-02T13:21:51.983252Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2607.01202"},"observation_digest":"sha256:1791727332770db6d09e900d559c8b78c1e59d41c0d6d28a2ffdf80f4a321ac7","observation_id":"862c0820-c10b-4fef-9f83-a2ae97effe78","resolution":{"observed_at":"2026-07-02T13:26:58.560815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-08-01T22:41:46.096258Z","title":"Yu Wu, Minsik Jeon, Jen-Hao Rick Chang, Oncel Tuzel, and Shubham Tulsiani","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15667","last_updated":"2026-07-17T06:22:14Z","snapshot_observed_at":"2026-08-16T10:05:20.761585Z","submitted_at":"2026-07-17T06:22:14Z","title":"PE-Field 4D: Video Generation Models as Canvas","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T22:41:46.096258Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2607.15667"},"observation_digest":"sha256:7789db41dc2283c01fcb7ae9dbbd61edcb0e872ba7da8c6b88767988afacce24","observation_id":"0645d784-629a-4ccb-8952-4f9105147608","resolution":{"observed_at":"2026-08-01T22:41:46.096258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-08-06T12:52:07.557992Z","title":"arXiv preprint arXiv:2506.05284 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04964","last_updated":"2026-08-05T15:34:47Z","snapshot_observed_at":"2026-08-13T03:30:27.643726Z","submitted_at":"2026-08-05T15:34:47Z","title":"WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T12:52:07.557992Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2608.04964"},"observation_digest":"sha256:b8d454516f3b1f6d7cf472b972f5a0caf673f90e6888f7d9f3ef11921e6dfea3","observation_id":"9e44f665-33e6-4ece-8411-de2300489ce0","resolution":{"observed_at":"2026-08-06T12:52:07.557992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-08-08T11:36:53.778505Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05523","last_updated":"2026-08-06T02:01:05Z","snapshot_observed_at":"2026-08-14T03:01:55.020127Z","submitted_at":"2026-08-06T02:01:05Z","title":"HERA: Historical Evidence Routing Adapter for Physical Prediction in Latent World Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T11:36:53.778505Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2608.05523"},"observation_digest":"sha256:a586c65cff64ea9755aed5930a553d6ab95a40645a638cb2ff6c0265b4ab4385","observation_id":"414c18ac-e99d-4152-bbcd-d0ddc054637c","resolution":{"observed_at":"2026-08-08T11:36:53.778505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-08-10T05:06:52.002085Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-16T13:12:28.441632Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.002085Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:261e11e34cace9b81b4d6dfe928773e628d2ed2a5d829de773f22e340910cbba","observation_id":"45019931-55ad-42dd-9581-576a360adc4c","resolution":{"observed_at":"2026-08-10T05:06:52.002085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05284/citation-record","integrity":"/paper/2506.05284/integrity","json":"/paper/2506.05284/citation-record.json","paper":"/paper/2506.05284"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:35.832506Z","title":"Diffusion for world modeling: Visual details matter in atari","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:35.832506Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:434afc0ae5ed5a538d32b3ec88789347516ea96843764416b37d4628b9fab8c1","observation_id":"91a5c251-1319-4aca-b8bf-4882500c1441","resolution":{"observed_at":"2026-08-07T10:28:35.832506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:35.902884Z","title":"Genesis: A universal and generative physics engine for robotics and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:35.902884Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:7c4f68f6d465559c7772927c9b121b05e7749fb30c8b1e6ca0c506a57d733605","observation_id":"6bf78689-d1cd-4efc-a1d0-84e1097b0921","resolution":{"observed_at":"2026-08-07T10:28:35.902884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:35.974939Z","title":"Essentials of human memory","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:35.974939Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:425ccc98fc87dbb7c25f549f4c6d3353d40fc0222b33434f60e0bec32cb382ce","observation_id":"f27438cb-c0fd-4dac-ab76-fb27d11c4915","resolution":{"observed_at":"2026-08-07T10:28:35.974939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:36.071006Z","title":"Lindell, and Sergey Tulyakov","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:36.071006Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:781d3423c38dc45092a61bcade585d9982637992a579c28b6edaefec250f3d67","observation_id":"6392592d-07b3-41ca-a3f2-5c8c1645d581","resolution":{"observed_at":"2026-08-07T10:28:36.071006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:36.163159Z","title":"Lindell, and Sergey Tulyakov","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:36.163159Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:856b86aedfaa8ae45c4ea2283525ead9df65799bb4a057f8fd3aaa2b68332ccc","observation_id":"80fbbd4e-104c-4f2b-ba09-235053dc10ee","resolution":{"observed_at":"2026-08-07T10:28:36.163159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11647","last_updated":"2025-07-09T08:09:06Z","snapshot_observed_at":"2026-08-16T12:49:55.041410Z","submitted_at":"2025-03-14T17:59:31Z","title":"ReCamMaster: Camera-Controlled Generative Rendering from A Single Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11647","snapshot_observed_at":"2026-08-07T10:28:36.252319Z","title":"Recammaster: Camera-controlled generative rendering from a single video, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:36.252319Z"},"links":{"cited_paper":"/paper/2503.11647","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:a507b2156121bf6f62e4b1ef1051f6d5021d002662a9c06ee6ec64a19607dd61","observation_id":"c885a79c-d2f5-4946-be26-8558814b2f3d","resolution":{"observed_at":"2026-08-07T10:28:36.252319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:36.339653Z","title":"Syncammaster: Synchronizing multi-camera video generation from diverse viewpoints","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:36.339653Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:473473a1295483d8441c92205d4b172bb5ced09887b684cfd6b7f58e3053c2ef","observation_id":"bfbd776c-2d70-482a-b724-59789be04f9f","resolution":{"observed_at":"2026-08-07T10:28:36.339653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T10:28:36.546649Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:36.546649Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:e020704e22b18084428c6ffe2fa73ee581e29a1a13415b93fa842cf44d967326","observation_id":"4862582a-f8fc-41a9-a43b-5be1a04433a4","resolution":{"observed_at":"2026-08-07T10:28:36.546649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:36.680441Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:36.680441Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:08aabd0b3452826489036f07825b41306e68b6d3db17cebdc8a5a824bf9e60f9","observation_id":"923a043e-f882-477b-b327-baef14bfdb3d","resolution":{"observed_at":"2026-08-07T10:28:36.680441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:36.763659Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:36.763659Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:a5f33f8e0d275d9df5ab2e722fec63f45c7f53bd7c0f4b64f3970d5eaa79aa35","observation_id":"1c1d54ed-5491-4d28-aed4-993cdebfc635","resolution":{"observed_at":"2026-08-07T10:28:36.763659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00769","last_updated":"2024-12-06T13:09:43Z","snapshot_observed_at":"2026-08-16T13:03:43.414170Z","submitted_at":"2024-11-01T17:59:17Z","title":"GameGen-X: Interactive Open-world Game Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00769","snapshot_observed_at":"2026-08-07T10:28:36.827996Z","title":"Gamegen-x: Interactive open-world game video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:36.827996Z"},"links":{"cited_paper":"/paper/2411.00769","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:330fdaed000b058c518f0d93d2da5b3836cac382267211b5d6a9e8a0fcb89919","observation_id":"5f241a0b-d1f9-4468-8b2e-ef6c19675a03","resolution":{"observed_at":"2026-08-07T10:28:36.827996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:36.898038Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:36.898038Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:f712720fdbc50b7587108ab3753927d2ff11514db3815ac60ea7b434cff08fe9","observation_id":"2dc9de1d-22af-4dcd-b894-9e2cee932aad","resolution":{"observed_at":"2026-08-07T10:28:36.898038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:36.959518Z","title":"Skyreels-v2: Infinite-length film generative model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:36.959518Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:0fe4ea5f40849d3246667e718bae76171eb6400dcf6a57402de8c90349314795","observation_id":"93eaeb15-0c62-4f99-87ab-e5a61f4c15aa","resolution":{"observed_at":"2026-08-07T10:28:36.959518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13265","last_updated":"2025-03-19T08:26:31Z","snapshot_observed_at":"2026-08-16T12:49:19.827110Z","submitted_at":"2025-03-17T15:18:38Z","title":"FlexWorld: Progressively Expanding 3D Scenes for Flexiable-View Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13265","snapshot_observed_at":"2026-08-07T10:28:37.035329Z","title":"Flexworld: Progressively expanding 3d scenes for flexiable-view synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:37.035329Z"},"links":{"cited_paper":"/paper/2503.13265","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:1523352a98d5b18b0ddb180559332e729f75bd73973a9e4b18b5c588b0005e67","observation_id":"d1cfa4da-a4d7-4852-a9e8-f397c0aa5e7f","resolution":{"observed_at":"2026-08-07T10:28:37.035329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:37.101723Z","title":"Seine: Short-to-long video diffusion model for generative transition and prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:37.101723Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:0bf8c70c27d787f7d4daae0fec363823c11d3b5017b6783f41c551b629b7deee","observation_id":"faf5cd2c-3ffc-40b3-a2ec-26c23d9b1102","resolution":{"observed_at":"2026-08-07T10:28:37.101723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:49.891082Z","title":"Oasis: A universe in a transformer","venue":null,"work_id":"1450012b-442a-4701-b13f-6e453c2906b3","year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:37.168324Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:32f4cbb5a96888d40c32b84a8987d66501899b622815c821185f96f4e78780cc","observation_id":"567fd608-ebdf-4eeb-b0f1-419488d02439","resolution":{"observed_at":"2026-08-07T10:28:50.011566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:49.635624Z","title":"Oasis: A universe in a transformer","venue":null,"work_id":"db99684f-f326-4f53-87f8-30aed759cdbe","year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:37.259088Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:aafdef493dd38dbdc691affb9a6afb724dd09272054f12b9f23816c2fc5fba1b","observation_id":"f177e406-38fd-411d-a3ae-97ee406d55a2","resolution":{"observed_at":"2026-08-07T10:28:49.729793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.05233","snapshot_observed_at":"2026-08-07T10:28:37.342105Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:37.342105Z"},"links":{"cited_paper":"/paper/2105.05233","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:54f542e8de829adda497fc8af586d80c977180b01b7cc900748d2fc99b612f80","observation_id":"1d6484bd-3529-4b7d-b7e0-813a1e1e18c5","resolution":{"observed_at":"2026-08-07T10:28:37.342105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:49.418437Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"f27d1373-e1ea-49af-b38c-ef91a743d649","year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:37.412842Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:a843db8f002e5eb1855bd369e44ad7b341f89939c39e26aecfea2c9cdcef5b5f","observation_id":"9dda24dc-473b-4a7c-8fe5-ae754093ebe2","resolution":{"observed_at":"2026-08-07T10:28:49.537809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03568","last_updated":"2024-12-04T18:59:05Z","snapshot_observed_at":"2026-08-17T08:30:58.061060Z","submitted_at":"2024-12-04T18:59:05Z","title":"The Matrix: Infinite-Horizon World Generation with Real-Time Moving Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03568","snapshot_observed_at":"2026-08-07T10:28:37.515228Z","title":"The matrix: Infinite-horizon world generation with real-time moving control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:37.515228Z"},"links":{"cited_paper":"/paper/2412.03568","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:3fcfa73b4b59089e89438531b8767b0207cf0c027336cd92bcb436deaa2808f8","observation_id":"457f001d-7f25-4616-9ce8-e5060f72732d","resolution":{"observed_at":"2026-08-07T10:28:37.515228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10981","last_updated":"2024-06-16T15:37:22Z","snapshot_observed_at":"2026-08-16T18:32:29.239159Z","submitted_at":"2024-06-16T15:37:22Z","title":"ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10981","snapshot_observed_at":"2026-08-07T10:28:37.579879Z","title":"Vid-gpt: Introducing gpt-style autoregressive generation in video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:37.579879Z"},"links":{"cited_paper":"/paper/2406.10981","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:1884ab4666db333e3210df4d1c33383a4616fb17c8625f871516db28006ddedf","observation_id":"9fe474e8-794c-45fa-b6ea-aea7aff9f106","resolution":{"observed_at":"2026-08-07T10:28:37.579879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16375","last_updated":"2025-05-21T10:38:01Z","snapshot_observed_at":"2026-08-17T01:27:04.025030Z","submitted_at":"2024-11-25T13:33:41Z","title":"Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16375","snapshot_observed_at":"2026-08-07T10:28:37.670335Z","title":"Ca2- vdm: Efficient autoregressive video diffusion model with causal generation and cache sharing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:37.670335Z"},"links":{"cited_paper":"/paper/2411.16375","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:7f6de29a4fb33448ea6643c7cf3e07298716b4b39d5db16a614769c4d724cb43","observation_id":"80aac502-dcbf-4189-9864-0b149aa2a270","resolution":{"observed_at":"2026-08-07T10:28:37.670335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-08-15T15:00:19.916941Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-07T10:28:37.767483Z","title":"Long-context autoregressive video mod- eling with next-frame prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:37.767483Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:1c487f2923a75399073e6319acd18e481acb395a23700234fcb731600715fdd2","observation_id":"8da434c8-387a-4965-a4a8-655836b3b94c","resolution":{"observed_at":"2026-08-07T10:28:37.767483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03847","last_updated":"2025-01-09T04:25:42Z","snapshot_observed_at":"2026-08-16T09:31:46.329467Z","submitted_at":"2025-01-07T15:01:58Z","title":"Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03847","snapshot_observed_at":"2026-08-07T10:28:37.873352Z","title":"Diffusion as shader: 3d-aware video diffusion for versatile video generation control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:37.873352Z"},"links":{"cited_paper":"/paper/2501.03847","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:79a36f00c0d46f88bc92f9a2aef9ca9df6255975670f530c438bc202ce04221d","observation_id":"b2602980-6b33-4dd4-87d9-7a67ca80bfc8","resolution":{"observed_at":"2026-08-07T10:28:37.873352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:49.155650Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"7e78d9e9-9d78-4786-86e5-978456ed471a","year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:37.961424Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:b732c6f0a16463f1cbaa464a2aa0db119d687d95d2618c28f39b75e41990f692","observation_id":"2ea90706-e38e-4690-8667-0c9fcd51b660","resolution":{"observed_at":"2026-08-07T10:28:49.316341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.910332Z","title":"Recurrent world models facilitate policy evolution","venue":null,"work_id":"f1566303-5206-41cc-80a8-b0907f3f03bb","year":2018},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:38.041172Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:74e5e4510235268b836a7d508cbb8e8f0a60cfcbcd5ccd812bfd49e789ec0a1d","observation_id":"0c757e0e-edd2-4879-8014-0db92081aa5a","resolution":{"observed_at":"2026-08-07T10:28:49.027141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-07T10:28:38.104382Z","title":"Ltx-video: Realtime video latent diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:38.104382Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:b42ed7b8bd9accfe0a9866a935609a7f6c18b54888060f7a509a2841771f0d58","observation_id":"35f74367-9eb2-4c6f-9c02-dab29c2e1aab","resolution":{"observed_at":"2026-08-07T10:28:38.104382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-15T17:22:37.525122Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-07T10:28:38.173494Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:38.173494Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:ddaa89785f9616b487391b8ab23e7a7ece13536684dcb8d68ab3e1c8b3083c31","observation_id":"948e9737-8f24-49ba-b688-82b102fc7d28","resolution":{"observed_at":"2026-08-07T10:28:38.173494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.700885Z","title":"Cameractrl: Enabling camera control for video diffusion models","venue":null,"work_id":"481c3092-b775-4417-90fa-2730a251aef8","year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:38.253795Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:4a559f738d90e4f416f41625bde2b32baa6c06dc88126c3ed1cfc44d0f25f232","observation_id":"bab5eb94-9035-47ed-aa7c-fed1d6fe2ee9","resolution":{"observed_at":"2026-08-07T10:28:48.771677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10592","last_updated":"2025-03-13T17:42:01Z","snapshot_observed_at":"2026-08-16T12:50:17.421166Z","submitted_at":"2025-03-13T17:42:01Z","title":"CameraCtrl II: Dynamic Scene Exploration via Camera-controlled Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10592","snapshot_observed_at":"2026-08-07T10:28:38.330512Z","title":"Cameractrl ii: Dynamic scene exploration via camera- controlled video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:38.330512Z"},"links":{"cited_paper":"/paper/2503.10592","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:9f7009b8ae6ae1802930a4cd5e9adfad3c7545c9c8ab9cc2a8239d04a1703984","observation_id":"0bc675b5-4a32-4197-ae02-6ab13e16b98f","resolution":{"observed_at":"2026-08-07T10:28:38.330512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-17T16:16:01.560363Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-07T10:28:38.402967Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:38.402967Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:c727adab971aedfa0891773ac7cb9f3f5681d109afd13e079b4e82a70642f005","observation_id":"8bcf8818-a277-4f88-839b-f0f9a3320742","resolution":{"observed_at":"2026-08-07T10:28:38.402967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-16T14:07:33.787785Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-07T10:28:38.472290Z","title":"Streamingt2v: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:38.472290Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:4301c90a1c8bc59de234cf91b8981450b0375c4f02229496d4513b1dd70b0a58","observation_id":"91ae7894-17fd-4800-9cbe-1d0b00dd160e","resolution":{"observed_at":"2026-08-07T10:28:38.472290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:38.562690Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:38.562690Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:73acbfa16c40c28f3e5e8c1681738e7c6e58980205d44a98c0722b9761bcbe4a","observation_id":"b55d5107-a595-49ea-91d6-a02d183c69c3","resolution":{"observed_at":"2026-08-07T10:28:38.562690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.486938Z","title":"Video diffusion models","venue":null,"work_id":"0b03616e-7091-44b8-a140-4666dea724e3","year":2022},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:38.638729Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:b53fa022949a252d56ee78692603934ccdc11a4b86c8e7ac9e9a6732be1bf52b","observation_id":"6c6b97e6-8af1-47e5-a362-1b05b407af06","resolution":{"observed_at":"2026-08-07T10:28:48.558564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:38.674751Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:38.674751Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:758132487af3f2eb2c97c9a7f8fa578daa09c94effe9d1737b09e5ba23c5d208","observation_id":"b1da9053-045e-4dda-9e71-347a4250fc7a","resolution":{"observed_at":"2026-08-07T10:28:38.674751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:38.764229Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:38.764229Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:c3fa0800728cca6bbaaa3a0316d1fba76004e85865c4137bde9683f4d8ce1ab1","observation_id":"bed39db2-a54b-42fa-ab93-bd6cc55a0835","resolution":{"observed_at":"2026-08-07T10:28:38.764229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:38.855269Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:38.855269Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:ebe9743ac773b2ec4b818363d094fb69dc1cafcb17bc7c7005f675623a4d2003","observation_id":"953bf0cc-7db2-4310-afde-33fa65007a9c","resolution":{"observed_at":"2026-08-07T10:28:38.855269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06358","last_updated":"2024-07-08T19:58:59Z","snapshot_observed_at":"2026-08-16T13:36:00.528382Z","submitted_at":"2024-07-08T19:58:59Z","title":"MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06358","snapshot_observed_at":"2026-08-07T10:28:38.940419Z","title":"Miradata: A large-scale video dataset with long durations and structured captions, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:38.940419Z"},"links":{"cited_paper":"/paper/2407.06358","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:d2f19aae7d3f66d3a5bef9ca23e1c15c376950c152cb074f10a1a9d2a5499479","observation_id":"8bebd46a-7809-49b1-82df-feac7956dab0","resolution":{"observed_at":"2026-08-07T10:28:38.940419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.217063Z","title":"Videopoet: A large language model for zero-shot video generation","venue":null,"work_id":"8e3474d0-de10-4038-9999-0852a2443a8f","year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.015650Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:10be89bed8f52e111a4e28f5d64c7fb62d8397b3258d7c0acf53a1816c319423","observation_id":"920a28e6-176f-449b-bcb9-03face9391f9","resolution":{"observed_at":"2026-08-07T10:28:48.339249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T10:28:39.075441Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.075441Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:e0d5ec208a7fa07cdd92aad766854ba6c1e0692841b25ba08c30bb8b77c49a15","observation_id":"898988a5-0fba-4b7e-8b41-1dc16d0b15fb","resolution":{"observed_at":"2026-08-07T10:28:39.075441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.01523","last_updated":"2018-04-04T17:55:40Z","snapshot_observed_at":"2026-08-16T16:05:25.921493Z","submitted_at":"2018-04-04T17:55:40Z","title":"Stochastic Adversarial Video Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.01523","snapshot_observed_at":"2026-08-07T10:28:39.157223Z","title":"Lee, Richard Zhang, Frederik Ebert, P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.157223Z"},"links":{"cited_paper":"/paper/1804.01523","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:12baf608ce4a70672d332ff0bb59dc9d1ec9772a73ff9b217d0d27d57f88fffd","observation_id":"6f0f827e-766a-425b-91d6-8d6d9ed10ccb","resolution":{"observed_at":"2026-08-07T10:28:39.157223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.057344Z","title":"Efficient spatially sparse inference for conditional gans and diffusion models","venue":null,"work_id":"6888af4f-3f78-416b-a285-796b1ea34b9a","year":2022},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.239472Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:172770340006cc794a1b29b9969cff3d6916f946019288af0ef7bb842c808cba","observation_id":"f9770c06-45ca-4b84-8ad9-e86cede4e095","resolution":{"observed_at":"2026-08-07T10:28:48.096228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:39.287888Z","title":"Megasam: Accurate, fast and robust structure and motion from casual dynamic videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.287888Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:4f5b63404ac6d9cbfe7a074c8286f257d3954ab1ca384af4ceeef65c81e8b3d2","observation_id":"26982cc4-6593-4f19-aaad-666465b4e2d3","resolution":{"observed_at":"2026-08-07T10:28:39.287888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-07T10:28:39.369402Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.369402Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:f8fb4d9c9e7494017651d9091ad1ade4ae53dd3ef0dcf2450cfe1a52effc90ed","observation_id":"fc57380e-c90a-400f-bce8-bfb6d55c932e","resolution":{"observed_at":"2026-08-07T10:28:39.369402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T10:28:39.425630Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.425630Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:717942151edd7963ad06e2a4aedad07e604d83c7eb84056d84127eb2473ef794","observation_id":"923bbfeb-34d1-416d-8c1d-d0c3d911c1c0","resolution":{"observed_at":"2026-08-07T10:28:39.425630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02097","last_updated":"2024-10-17T08:09:37Z","snapshot_observed_at":"2026-08-18T07:06:04.890772Z","submitted_at":"2024-09-03T17:54:39Z","title":"LinFusion: 1 GPU, 1 Minute, 16K Image","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02097","snapshot_observed_at":"2026-08-07T10:28:39.512049Z","title":"Linfusion: 1 gpu, 1 minute, 16k image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.512049Z"},"links":{"cited_paper":"/paper/2409.02097","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:093c5feb52f355f23be84a6f8f6c21592257a8c63a22312227185bdde5665986","observation_id":"d98c8544-43ef-4d71-ba2b-244e82ba604d","resolution":{"observed_at":"2026-08-07T10:28:39.512049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05440","last_updated":"2016-02-26T22:10:30Z","snapshot_observed_at":"2026-08-14T22:22:34.655459Z","submitted_at":"2015-11-17T15:36:32Z","title":"Deep multi-scale video prediction beyond mean square error","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05440","snapshot_observed_at":"2026-08-07T10:28:39.609601Z","title":"Deep multi-scale video prediction beyond mean square error","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.609601Z"},"links":{"cited_paper":"/paper/1511.05440","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:7d9c85d5bb931edfa1502a8b302ed1f666e1d067bbd85835103b870aeee15c47","observation_id":"150d21ee-eda9-4bc3-9bcb-7f202f1ac7d9","resolution":{"observed_at":"2026-08-07T10:28:39.609601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07711","last_updated":"2026-06-27T16:03:47Z","snapshot_observed_at":"2026-08-17T01:35:09.763246Z","submitted_at":"2024-03-12T14:53:56Z","title":"SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07711","snapshot_observed_at":"2026-08-07T10:28:39.676384Z","title":"Ssm meets video diffusion models: Efficient long-term video generation with structured state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.676384Z"},"links":{"cited_paper":"/paper/2403.07711","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:5da0922fee2a1c3e16ccffd42372f44a5f31ed218ad28698a585c5f754d64b7d","observation_id":"8a0f1c6c-608a-491d-abfe-ccea54cb7c7a","resolution":{"observed_at":"2026-08-07T10:28:39.676384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:39.746094Z","title":"Genie 2: A large-scale foundation world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.746094Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:26dbeebb52385cf319a4d6e02f9d58c442270152dcdb5f1e69d604ec76ab2680","observation_id":"650fe828-f1c7-44ca-a01c-9b2a9817dab6","resolution":{"observed_at":"2026-08-07T10:28:39.746094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.833757Z","title":"Genie 2: A large-scale foundation world model","venue":null,"work_id":"fa58dcc8-63bb-4289-a8f4-8830e883cc69","year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.818205Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:5a836fdefc9cd87b40d618abad58281c26ec756741b5a511185443a2560a36c6","observation_id":"42c0bced-6059-4722-85cd-b8f9fff41589","resolution":{"observed_at":"2026-08-07T10:28:47.912744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.607564Z","title":"State of the art on diffusion models for visual computing","venue":null,"work_id":"8da04153-dded-4b8f-8b9c-63913482d2f2","year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.894471Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:29522abc6299baa3ec80311fc9eec01c82ebe76ce885bad7e751172f8eef50c7","observation_id":"d2b0527d-676e-40e1-bf04-ab271b50f2d4","resolution":{"observed_at":"2026-08-07T10:28:47.725079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10841","last_updated":"2025-02-15T16:08:40Z","snapshot_observed_at":"2026-08-16T12:58:07.365732Z","submitted_at":"2025-02-15T16:08:40Z","title":"SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10841","snapshot_observed_at":"2026-08-07T10:28:39.944935Z","title":"Skyreels-a1: Expressive portrait animation in video diffusion trans- formers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.944935Z"},"links":{"cited_paper":"/paper/2502.10841","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:96ae01270fa2e987c669b3c652f84c451b6c4c65922b6b7a4c986d7739ae8c6d","observation_id":"bac918dd-2c4f-4780-a159-9a6088c77634","resolution":{"observed_at":"2026-08-07T10:28:39.944935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.395585Z","title":"Gen3c: 3d-informed world- consistent video generation with precise camera control","venue":null,"work_id":"37b61083-f8f7-4e93-b1a3-8b0b07b00ec7","year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.031042Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:dfd8a345723d677a0025fa66715d4bdc0e50b29cd66aeb2c538eb14f1ff1e39f","observation_id":"1bb67816-0a8d-4b2f-8a41-361d86c94510","resolution":{"observed_at":"2026-08-07T10:28:47.479521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.200241Z","title":"Structure-from-motion revisited","venue":null,"work_id":"f4eb96de-12f5-4bd8-9b46-3d170e832459","year":2016},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.128107Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:2667974376c8f46cc37e8cb4f3ef01c61479894b31e07be04da2952ba05f6420","observation_id":"dd58db0f-731a-4d55-8836-1d40c29b5c18","resolution":{"observed_at":"2026-08-07T10:28:47.270600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:40.210493Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.210493Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:98e1efba6d2a61dfd424634943a6718a565e3afe345f7bed1f6c3950c0da140b","observation_id":"5640641d-4758-41f7-90b7-c9831286f6e4","resolution":{"observed_at":"2026-08-07T10:28:40.210493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.068925Z","title":"Deep unsuper- vised learning using nonequilibrium thermodynamics","venue":null,"work_id":"dbda1625-0c34-4240-aae6-6d696fc30029","year":2015},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.280357Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:3cf405090c04d636a23e6e317bcd99b171ef81aee9042806c70b99ae3bb786b9","observation_id":"c6b775c6-4cc2-4aae-a5a7-088e433cff21","resolution":{"observed_at":"2026-08-07T10:28:47.116687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-08-13T16:17:52.423891Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06764","snapshot_observed_at":"2026-08-07T10:28:40.360174Z","title":"History-guided video diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.360174Z"},"links":{"cited_paper":"/paper/2502.06764","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:75502459494ac6e4b1678e9672f720bbcc49bbec9881299646cbd6050cbdaf97","observation_id":"6198f0ed-8a9f-4334-8a3e-e5bdff7b889f","resolution":{"observed_at":"2026-08-07T10:28:40.360174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:40.445905Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.445905Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:114460fcae355937c82eccf24cd67e9f75b62f4020c4142d130f0f046d147edf","observation_id":"78ffb01a-386c-4b56-89f4-ecfe978b6a74","resolution":{"observed_at":"2026-08-07T10:28:40.445905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T10:28:40.535351Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.535351Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:346ec3101491a5d1441cdc2af8aa971e4ffd6d111a755070aba24d9fe8ca6ddb","observation_id":"fb396d7f-bd13-4e2b-8828-13e7b8d3babe","resolution":{"observed_at":"2026-08-07T10:28:40.535351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-16T02:26:48.104166Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13061","snapshot_observed_at":"2026-08-07T10:28:40.611770Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.611770Z"},"links":{"cited_paper":"/paper/2412.13061","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:9ef864ed084c41adc9f1244a02a733c06a4e2677a12a395ef8a643f5dd23b38a","observation_id":"33048bd2-577b-4e5a-97b2-1f0dc8a1447e","resolution":{"observed_at":"2026-08-07T10:28:40.611770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.929508Z","title":"Tulyakov, Ming-Yu Liu, Xiaodong Yang, and Jan Kautz","venue":null,"work_id":"da3cf8a0-a156-4f4c-af89-8f933bd92601","year":2018},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.680078Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:02ffac295f29321d98ef454847b15ab40772cacaa7a033404087d92e800712a4","observation_id":"b1705ef8-544a-44c0-acaf-b86f0eeccbce","resolution":{"observed_at":"2026-08-07T10:28:46.994720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-08-14T07:06:06.462400Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-07T10:28:40.743811Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.743811Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:333a2b4a147affe84b22443e528269ac45c0c3c4d7a35c06d240b31ecfd832ec","observation_id":"4ba40cbd-d454-4f05-88da-2bc89c7e760e","resolution":{"observed_at":"2026-08-07T10:28:40.743811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.712975Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"a79d4bec-0698-41f5-a05f-d0456a8a9bf3","year":2023},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.806367Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:2d2011f0995116c5a7cd587b074b5628384b301afbeed8ecae9f504432a7831f","observation_id":"b608fb8a-9e4b-46b7-93ca-4c742eefa483","resolution":{"observed_at":"2026-08-07T10:28:46.824742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.524766Z","title":"Generating the future with adversarial transformers.2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , pages 2992–3000,","venue":null,"work_id":"2c4993c4-7df4-4389-bdfa-7fed23767bc7","year":2017},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.943015Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:c2dd1b27705332a4fd3022c077889a333823d5182240386e411b25da73a24701","observation_id":"efe980eb-a7dc-4451-8b91-b9a084c35640","resolution":{"observed_at":"2026-08-07T10:28:46.600190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T10:28:41.155178Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.155178Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:a9c3b82e8e1c33f34c8904f5a7b2fa2abc1dc39103ecdc6a3a0681669cfb0cbb","observation_id":"9756e0d0-e1ce-43e5-885d-66139b2525c0","resolution":{"observed_at":"2026-08-07T10:28:41.155178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-15T01:14:53.670017Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09856","snapshot_observed_at":"2026-08-07T10:28:41.279115Z","title":"Lingen: Towards high-resolution minute-length text-to-video generation with linear compu- tational complexity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.279115Z"},"links":{"cited_paper":"/paper/2412.09856","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:8d9c39b397c99e7a7c318bd5f9ffa01f4cc601b44ff12629e99d480fb40cfa05","observation_id":"0c076b86-9971-4220-859b-86de36be2480","resolution":{"observed_at":"2026-08-07T10:28:41.279115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:41.344821Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.344821Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:b8162b682c395001864e9656047c643254fd3ea1cf67d53d9bfa3dcc65803a11","observation_id":"35dfcb79-a2ca-4277-a81e-bee7481ebd00","resolution":{"observed_at":"2026-08-07T10:28:41.344821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.137049Z","title":"Efros, and Angjoo Kanazawa","venue":null,"work_id":"64300ede-2afa-4e57-bd9e-7a7751a616df","year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.445162Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:558e5a726d9e6d0b5f708f88891e9824692d5a26fdee0f6140abb5392fee6292","observation_id":"c79fc6c5-3e2a-453a-b376-4d5fc398147b","resolution":{"observed_at":"2026-08-07T10:28:46.242640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:45.892795Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":"28d6d961-84db-4c7f-ace7-0e0238343fb6","year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.541169Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:8ce10233a497a1da5670102538075aab2549db7700bb430e4711b06832f281a0","observation_id":"82dba669-720b-4ccc-ad3f-5a561fbd876a","resolution":{"observed_at":"2026-08-07T10:28:45.998420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-16T13:12:51.397672Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T10:28:41.605178Z","title":"Loong: Generating minute-level long videos with autoregressive language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.605178Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:541481d40e2cd982812ebd9c8eab91e1737159341fbe0040bf6a2f76c8d663f9","observation_id":"ecf31cbd-af7b-4861-b57c-eee64139f826","resolution":{"observed_at":"2026-08-07T10:28:41.605178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:45.664734Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"743f3b18-88a0-4c6a-ba5c-c8a5cfd8f3ed","year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.683046Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:a80855b51c4cd1bba152e4750fa9a7274d7fb78e60011e42214778c9219218a9","observation_id":"346b2173-a322-4bcf-ba62-ea411bf4285d","resolution":{"observed_at":"2026-08-07T10:28:45.760855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:41.761985Z","title":"Art-v: Auto-regressive text-to-video generation with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.761985Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:3def47b111ea3136f828f175434ccb83399e4c07576872d2ae4e65ddb39352f7","observation_id":"a9c3a7dd-7d1b-4b93-b67a-a1951d8c7b08","resolution":{"observed_at":"2026-08-07T10:28:41.761985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:41.851167Z","title":"Day- dreamer: World models for physical robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.851167Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:c60e143bd2fc487052e139f893b67bc472271c1620d8685b781f8caf2ddcf5b3","observation_id":"e9ca8eb2-5088-473b-be6c-5bb893b5dbe2","resolution":{"observed_at":"2026-08-07T10:28:41.851167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-08-16T01:17:28.297637Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-07T10:28:41.924378Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.924378Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:fe4da8f500bd5d4cb8266c5f96fe370712432ad98733bc914956c9b104cedbbd","observation_id":"77f13cd1-39e1-457b-9fe4-b9b73e9c5642","resolution":{"observed_at":"2026-08-07T10:28:41.924378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-07T10:28:42.033727Z","title":"Videogpt: Video generation using vq-vae and transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.033727Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:1dde048d73f2facf92046cf9fbbb34eba518863bc78d61496bae53f9e3c84c23","observation_id":"578cb817-fdf2-44c5-97b2-5af84d59e2e8","resolution":{"observed_at":"2026-08-07T10:28:42.033727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T10:28:42.170961Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.170961Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:4c252ce1b5bf84b2c4130393bd778f12c2be8209b0f5a2210b0fbb7cd561091e","observation_id":"a576982a-8a90-4d48-8c81-f064dfeaffd5","resolution":{"observed_at":"2026-08-07T10:28:42.170961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T10:28:42.341717Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.341717Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:c0020fd9345a533266c5e92255d968bc8cae3ad3976c8ef2fd1e3c9bf03076b2","observation_id":"fa6f67a1-71d8-419d-bf7c-402827964e8f","resolution":{"observed_at":"2026-08-07T10:28:42.341717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:42.440172Z","title":"From slow bidirectional to fast autoregressive video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.440172Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:d44d3f1660834c431466876d1a5ccb9e03cfe0ab2de12dcb26b8795304bb0848","observation_id":"ec7b3033-cde7-4ca8-a057-45b06dcf9570","resolution":{"observed_at":"2026-08-07T10:28:42.440172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:42.536739Z","title":"Gamefactory: Creating new games with generative interactive videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.536739Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:5c4962ad7ba309197b09db9976d25e44d0397c2a1303f41911c3a380ab9804f4","observation_id":"541332ae-a3ed-4498-8c20-6ed833bca460","resolution":{"observed_at":"2026-08-07T10:28:42.536739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05638","last_updated":"2025-03-07T17:57:53Z","snapshot_observed_at":"2026-08-16T12:52:05.912150Z","submitted_at":"2025-03-07T17:57:53Z","title":"TrajectoryCrafter: Redirecting Camera Trajectory for Monocular Videos via Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05638","snapshot_observed_at":"2026-08-07T10:28:42.630970Z","title":"Trajectorycrafter: Redirecting camera trajectory for monocular videos via diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.630970Z"},"links":{"cited_paper":"/paper/2503.05638","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:19c4d03b447f0649689c7643bdde467729a25dda1f15f5cbbf28817e51fc191f","observation_id":"c231cf10-62dc-4d3c-b1c2-8289b9868f84","resolution":{"observed_at":"2026-08-07T10:28:42.630970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02048","last_updated":"2024-09-03T16:53:19Z","snapshot_observed_at":"2026-08-14T12:22:44.567374Z","submitted_at":"2024-09-03T16:53:19Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02048","snapshot_observed_at":"2026-08-07T10:28:42.743161Z","title":"Viewcrafter: Taming video diffusion models for high-fidelity novel view synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.743161Z"},"links":{"cited_paper":"/paper/2409.02048","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:9445f31ee52dee01e89c1195690b7fabfec722a92d5a934c275b33392513edf3","observation_id":"8f70431b-57b1-48e1-93e2-85f0803f82a5","resolution":{"observed_at":"2026-08-07T10:28:42.743161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:45.411172Z","title":"3dmatch: Learning local geometric descriptors from rgb-d reconstructions","venue":null,"work_id":"9f527d8e-eee1-4b09-9866-aed28871f914","year":2017},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.848662Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:f695424af054b3aa89928a61bb13077467db1b68db55e083c19f1b7d555119f7","observation_id":"2412f064-393b-43f9-a086-20f1648b7850","resolution":{"observed_at":"2026-08-07T10:28:45.494065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05003","last_updated":"2024-11-07T18:59:45Z","snapshot_observed_at":"2026-08-16T13:01:59.440586Z","submitted_at":"2024-11-07T18:59:45Z","title":"ReCapture: Generative Video Camera Controls for User-Provided Videos using Masked Video Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05003","snapshot_observed_at":"2026-08-07T10:28:42.973994Z","title":"Recapture: Generative video camera controls for user-provided videos using masked video fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.973994Z"},"links":{"cited_paper":"/paper/2411.05003","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:8d64f460c4e43f93031bda65d133bcd10482e928881e27e03a398aa81d50bb4a","observation_id":"882a93ac-51f8-4de7-8ee8-80fc75ec777e","resolution":{"observed_at":"2026-08-07T10:28:42.973994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:45.202946Z","title":"MonST3r: A simple approach for estimating geometry in the presence of motion","venue":null,"work_id":"2d7870c9-184e-4c3b-9694-78b19972a189","year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.082267Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:dc8642ced32f0c43bb4e19478fae3c331b939e68d8c5a101d503f4cd196d96e7","observation_id":"475e9458-5a6d-4f50-ae53-2bf000095282","resolution":{"observed_at":"2026-08-07T10:28:45.301963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:43.164649Z","title":"Packing input frame context in next-frame prediction models for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.164649Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:8d98a8c5bcddb5b06920cd10d8e26dc705aac4cc8618fb68a75bd06cf7de5b10","observation_id":"7bb73879-df32-4fe5-9870-8cd0aeacf65c","resolution":{"observed_at":"2026-08-07T10:28:43.164649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:45.038377Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"4fd96c78-37c9-4665-aa83-c3553b77316e","year":2023},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.283556Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:50ebfcf1917c588e6bcf919e9c50bcc4dfb7646965dea5f4cd2f2b5e72b0e1e7","observation_id":"e9b8db33-8f4a-402d-a8ed-cd749b9b1cbc","resolution":{"observed_at":"2026-08-07T10:28:45.117681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:44.832054Z","title":"Flare: Feed-forward geometry, appearance and camera estimation from uncalibrated sparse views","venue":null,"work_id":"cc7c4fbc-bfd9-4134-bab5-7cded9dfb4ca","year":2025},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.364916Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:c524f0527d5d8feb017230434e2b447d160bf96a712239ebeb077b13ceeacbab","observation_id":"a3442e55-5134-470b-b5d3-8a41f3b9ab5a","resolution":{"observed_at":"2026-08-07T10:28:44.920227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:44.687812Z","title":"Extdm: Distribu- tion extrapolation diffusion model for video prediction","venue":null,"work_id":"cb049260-8773-45d7-bae6-110aca61816a","year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.465659Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:dbabe90be990dd3b4e268fc2e7900d4a10bd830600e254ecbbc013627bf4aef6","observation_id":"4c8090fb-4167-469e-8880-e49ae45c6563","resolution":{"observed_at":"2026-08-07T10:28:44.736677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-07T10:28:43.616440Z","title":"Open-sora: Democratizing efficient video production for all","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.616440Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:d8d4b7443c47fc00b8e0899f79627389c00ffa0c18c7d6e7c40e48bcb7e2e528","observation_id":"bfa0114f-2ef5-44e8-b93d-d320438d1c59","resolution":{"observed_at":"2026-08-07T10:28:43.616440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:43.713731Z","title":"Is sora a world simulator? a comprehensive survey on general world models and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.713731Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:0bde45bb960d76a7daaae7c71a3c3d884987236bc084350b6d9212a7c84ca350","observation_id":"b0e7afd5-b60e-4514-875c-0105f89f858f","resolution":{"observed_at":"2026-08-07T10:28:43.713731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.349427Z","title":null,"venue":null,"work_id":"7fafb6d5-cc7d-48de-be1e-9bb3a0b984b8","year":null},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.060766Z"},"links":{"citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:3eec587e9f98d4a94cfcfa206d493ab14d548be8084ee0be0a94120a56ab611f","observation_id":"cc429729-fe76-41ad-ae3b-8da671383f04","resolution":{"observed_at":"2026-08-07T10:28:46.414049Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 44 inbound Pith citation observations for arXiv:2506.05284."}