{"as_of":"2026-08-05T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f27c46998c0eb23f7bfcbbe5adb5ecabc3daae36155249357662e39f7260aa01","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T16:47:42.761342Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T13:05:26.397711Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T05:47:41.335193Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"cited_work":{"arxiv_id":"2606.09828","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.09828","snapshot_observed_at":"2026-07-03T05:47:41.335193Z","title":"Latent Spatial Memory for Video World Models","venue":"cs.CV","work_id":"52e38672-5514-4601-989d-70c1bb99d827","year":2026},"citing_paper":{"arxiv_id":"2606.11129","last_updated":"2026-06-23T05:28:32Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:24:36Z","title":"WorldOlympiad: Can Your World Model Survive a Triathlon?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T13:05:26.397711Z"},"links":{"cited_paper":"/paper/2606.09828","citing_paper":"/paper/2606.11129"},"observation_digest":"sha256:97e480315d30a9de379c559a094fd77c3d3f40f3a6e23c2aba63c1258242881d","observation_id":"230f8b24-10d8-44b2-944d-405378e52366","resolution":{"observed_at":"2026-07-03T05:47:41.336483Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.09828/citation-record","integrity":"/paper/2606.09828/integrity","json":"/paper/2606.09828/citation-record.json","paper":"/paper/2606.09828"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Sora.https://openai.com/sora/, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:85e9c39cfc3ab33cde42b84dd3727c6c6b434e383079882226b5d6fdf75ba9da","observation_id":"990bd036-d01b-49f8-918b-06808d48fd38","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:375519f281677714b3f3dde341887bb33a6edb4ed5293a841b3980ddfb28b682","observation_id":"778b2813-94f9-42ee-81b1-74f4c3492313","resolution":{"observed_at":"2026-07-03T01:07:30.622711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:9d715a89e22d8b5f5179f569a11297fd08872efff60b63926a58bf9f84a47247","observation_id":"5188ed02-ec1c-4eb1-aecd-fd8487065e69","resolution":{"observed_at":"2026-07-03T01:07:30.624495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:c6db49d680ab55916707338b5013178708ad66c87070206ce519661eb00fa12e","observation_id":"dc0681e3-b80a-4288-bb08-3af59c70f151","resolution":{"observed_at":"2026-07-03T01:07:30.569922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:2ad21ee9ced177762a1cc6785e81fd4fecfcd0d9f44bbd71ee4239dd65e60eeb","observation_id":"53df465a-52cc-4936-8dc9-309b0f9a44ff","resolution":{"observed_at":"2026-07-03T01:07:30.581500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:a2cd39ba7df5d3e165cb8a75abd1588a340b45f96214cbc99f486f91eb391cef","observation_id":"f1139cde-5575-4f4e-aead-f2b4f8a88a6f","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Genie 2: A large-scale foundation world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:3d715b9fd6944d0e8365c2ece129dd4aa01c659e6104b6301f104689de3a372d","observation_id":"5669ecf6-66a3-4218-840b-879a8f988b8b","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":"2408.14837","doi":"10.48550/arxiv.2408.14837","metadata_source":"pith","pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffusion Models Are Real-Time Game Engines","venue":"cs.LG","work_id":"3f074579-63c2-40bf-b5c8-c6a8c39d9319","year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:61dd3af6f2f73db80fe8c7446a485ebed59d4d543d168e928b0dfd9264790847","observation_id":"c5848669-8dfc-46a3-b493-d337bc04e11b","resolution":{"observed_at":"2026-07-03T01:07:30.564268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Diffusion for world modeling: Visual details matter in atari.Advances in Neural Information Processing Systems, 37:58757–58791, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:19fa3d55431b46ca52e71ad852a3dd826ca89a81b579767091c169365df8205e","observation_id":"3a7c5216-bf70-4e9f-aad0-5b8c82ab6864","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00769","last_updated":"2024-12-06T13:09:43Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-11-01T17:59:17Z","title":"GameGen-X: Interactive Open-world Game Video Generation","version":3},"cited_work":{"arxiv_id":"2411.00769","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00769","snapshot_observed_at":"2026-07-03T01:07:30.588949Z","title":"Gamegen-x: Interactive open-world game video generation","venue":null,"work_id":"5f3b923c-3fdc-468a-8951-94c4ff7b1e29","year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2411.00769","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:5ff1fa42b4c23ba02c5e5321e383894bb7547e53391501238b08090f74eaf725","observation_id":"a84ec768-7a5a-4f31-85a3-3e99ae30bd87","resolution":{"observed_at":"2026-07-03T01:07:30.590453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Spatia: Video generation with updatable spatial memory","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:2abdc34bff1b01cbb2be99816e9901e713774c437f3b78b655a890539c3d9230","observation_id":"d584c8e0-0bf8-41af-8251-329fcbdf6b20","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04225","last_updated":"2025-06-04T17:59:04Z","snapshot_observed_at":"2026-07-06T21:36:45.605379Z","submitted_at":"2025-06-04T17:59:04Z","title":"Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2506.04225","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04225","snapshot_observed_at":"2026-07-03T01:07:30.582726Z","title":"Voyager: Long-range and world-consistent video diffusion for explorable 3d scene generation","venue":null,"work_id":"75dd742e-3847-4289-8370-020a08011903","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2506.04225","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:8935897aab3f68b9881c246f25270b044284ffa98040ef3c1a6401d43e5a2152","observation_id":"9527c192-978c-442c-92ff-b4f96a806543","resolution":{"observed_at":"2026-07-03T01:07:30.584646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09394","last_updated":"2025-03-25T01:00:11Z","snapshot_observed_at":"2026-08-05T13:55:59.682067Z","submitted_at":"2024-06-13T17:59:10Z","title":"WonderWorld: Interactive 3D Scene Generation from a Single Image","version":4},"cited_work":{"arxiv_id":"2406.09394","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09394","snapshot_observed_at":"2026-07-07T12:53:50.421384Z","title":"Wonderworld: Interactive 3d scene generation from a single image","venue":"cs.CV","work_id":"bfb16292-ec6b-4af8-9987-d445b42387d1","year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2406.09394","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:55a8bd4775811a6233d541b4b4137fa5c46712f1c8f4742bd1db4158153ef297","observation_id":"f8b9fd73-8324-4d81-b9ac-8f523d07b4fd","resolution":{"observed_at":"2026-07-03T01:07:30.613347Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Wonderjourney: Going from anywhere to everywhere","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:ad1c9de34b1b5e82bb37986c9d77927bb4f53d0d8a950c94c0bb9e8808e9b8d2","observation_id":"48bb8dd4-3d6e-4232-9e8b-f464e34de3c4","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.07145","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:49:30.995441Z","title":"LiveWorld: Simulating out-of-sight dynamics in generative video world models","venue":null,"work_id":"ca4d01be-0052-4868-83e4-661d6913044a","year":2026},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:c90704fa7a452a7a37cf92c332c15f33948b182e98b75411ee9776e7867c4aea","observation_id":"1511a3e9-fe03-4caf-b227-f0322b9ad9d8","resolution":{"observed_at":"2026-07-03T01:07:30.581469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.15264","last_updated":"2026-05-25T12:48:39Z","snapshot_observed_at":"2026-08-04T09:29:16.602093Z","submitted_at":"2025-10-17T03:00:08Z","title":"DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion","version":3},"cited_work":{"arxiv_id":"2510.15264","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.15264","snapshot_observed_at":"2026-07-03T01:07:30.616058Z","title":"Drivegen3d: Boosting feed- forward driving scene generation with efficient video diffu- sion","venue":"cs.CV","work_id":"2b6a150a-589c-4e1b-ae1a-dbc6fb7c6096","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2510.15264","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:91f3778ae89d1286d2ae146c10f036992490f34d3403a72b046c3b4f4e6c9aad","observation_id":"96c59b79-4bf3-47d2-89e9-346d8137dd47","resolution":{"observed_at":"2026-07-03T01:07:30.617423Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24764","last_updated":"2026-05-26T15:39:12Z","snapshot_observed_at":"2026-08-01T14:38:01.273322Z","submitted_at":"2026-04-27T17:59:56Z","title":"World-R1: Reinforcing 3D Constraints for Text-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2604.24764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24764","snapshot_observed_at":"2026-07-04T13:19:51.033017Z","title":"World-R1: Reinforcing 3D Constraints for Text-to-Video Generation","venue":"cs.CV","work_id":"70dec119-55b1-4d43-89f8-5d5e534618b2","year":2026},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2604.24764","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:2505b3e2c30165248751314203b4efa1ecf4e778ba228db9e141001d9d877092","observation_id":"e5a1b005-f31c-4f2d-9ea5-0caac68328d6","resolution":{"observed_at":"2026-07-03T01:07:30.597836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-07-06T21:37:28.044836Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:ce51e94422db318146e6231062965b64a1fae21f30c566d22a4866fdc6e6aaa5","observation_id":"28a335ba-f5e4-4223-a2fb-0c33e2a2d615","resolution":{"observed_at":"2026-07-03T01:07:30.600792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.22815","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:07:30.600784Z","title":"Captain safari: A world engine","venue":null,"work_id":"52caf5ea-79fd-45e6-8991-e88ab6a940f7","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:041aaebbb380fc9a46983eb8c71268f990db7c0435c65436f8e9206958961dfa","observation_id":"74f807bd-b84f-47b0-b409-9ad097205e3f","resolution":{"observed_at":"2026-07-03T01:07:30.602248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Depth anything 3: Recovering the visual space from any views.International Conference on Learning Representations (ICLR), 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:06e13cc51f8abc75502268d57bd09d56bcebbc6ba85bd74e2f8ea2d80aceb104","observation_id":"a40b37c4-07ca-4a6f-9820-585ec5219d0e","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14025","last_updated":"2026-04-15T16:07:18Z","snapshot_observed_at":"2026-07-06T23:01:55.698452Z","submitted_at":"2026-04-15T16:07:18Z","title":"Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective","version":1},"cited_work":{"arxiv_id":"2604.14025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.14025","snapshot_observed_at":"2026-07-03T01:07:30.591718Z","title":"Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective","venue":"cs.CV","work_id":"28e56a3c-6e12-478c-868a-56da416ea8b3","year":2026},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2604.14025","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:b640af4f2adc05ed4378e16fac928d0e3f67524bca2509c4a14bb8313abdf838","observation_id":"51f5dbb6-521c-4134-bc84-c74b9f6dbe44","resolution":{"observed_at":"2026-07-03T01:07:30.592988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Zpressor: Bottleneck-aware compression for scalable feed-forward 3dgs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:20c517696dbe4f53cfd0e250d9f50fa1178e7f30cc52d54259784bf3c96ed3ef","observation_id":"c4abd168-1871-4c9f-8fe5-a7938ee64550","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.19297","last_updated":"2026-06-24T10:16:56Z","snapshot_observed_at":"2026-08-04T15:39:12.973533Z","submitted_at":"2025-09-23T17:59:02Z","title":"VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction","version":3},"cited_work":{"arxiv_id":"2509.19297","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.19297","snapshot_observed_at":"2026-07-04T13:19:51.046437Z","title":"V olsplat: Rethinking feed-forward 3d gaussian splatting with voxel-aligned prediction","venue":"cs.CV","work_id":"a1117a19-eb44-4a5b-866c-4918d06fbdd5","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2509.19297","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:bf500ecb80170d194b4f6af60581655f31abbee5e9bb6e965985a78f45062701","observation_id":"398d010d-89df-4676-8c2a-021bcae6b72b","resolution":{"observed_at":"2026-07-03T01:07:30.604666Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26115","last_updated":"2026-05-25T17:59:53Z","snapshot_observed_at":"2026-08-05T14:24:13.279939Z","submitted_at":"2026-05-25T17:59:53Z","title":"TriSplat: Simulation-Ready Feed-Forward 3D Scene Reconstruction","version":1},"cited_work":{"arxiv_id":"2605.26115","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.26115","snapshot_observed_at":"2026-07-03T01:07:30.614906Z","title":"TriSplat: Simulation-Ready Feed-Forward 3D Scene Reconstruction","venue":"cs.CV","work_id":"7431aab2-2552-451d-8cf9-6c6460cb1a51","year":2026},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2605.26115","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:9dcc18351641a4c89e971eeba05a80cd3cb6a49268c8ae2c041aea180eb169e5","observation_id":"f5822075-6c29-4512-8788-2162d5328b31","resolution":{"observed_at":"2026-07-03T01:07:30.616533Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Adding conditional control to text-to-image diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:105d9082f3cbfa93fa5b1821488093dbf8e0feb1593666ee3d689f9ecc95d06a","observation_id":"37ab7e0b-6690-4838-8540-9e76a0516d54","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:d4fbec4215dcc12030e1a78e558999206c834062264a73898db24b1260da7dac","observation_id":"86eed827-9d06-4a7a-9120-82f462e6a728","resolution":{"observed_at":"2026-07-03T01:07:30.595055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Worldscore: A unified evaluation benchmark for world generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:b69cc7704e953f50321e449f9454f3e75e8ca40c7d5c5544138dc4cf33819267","observation_id":"ed9153cc-8143-4d96-b3ff-9757bbe304c9","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.00983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:54.342857Z","title":"Worldscore: A unified evaluation benchmark for world generation","venue":null,"work_id":"ad14fa35-72b1-4530-b01a-6d41cd35888d","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:031985eae79c181b3a6d862bbbef17e85bb6dfa581a9d6e7ec2f0a34e90956d7","observation_id":"6bde1f3b-1b51-4638-845c-0b5e94121b4a","resolution":{"observed_at":"2026-07-03T01:07:30.609100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09817","last_updated":"2018-05-24T17:58:02Z","snapshot_observed_at":"2026-07-06T06:41:05.545426Z","submitted_at":"2018-05-24T17:58:02Z","title":"Stereo Magnification: Learning View Synthesis using Multiplane Images","version":1},"cited_work":{"arxiv_id":"1805.09817","doi":"10.1145/3197517.3201323","metadata_source":"pith","pith_arxiv_id":"1805.09817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stereo Magnification: Learning View Synthesis using Multiplane Images","venue":"cs.CV","work_id":"f6abb68f-df5c-4569-af1b-9ede43a44468","year":2018},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/1805.09817","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:2ea24fec1919bc8fae21c52ee4db291501aaa1699125939958ac25a96e07fcb7","observation_id":"fe347f30-0f91-429f-a311-bc8840580baa","resolution":{"observed_at":"2026-07-03T01:07:30.572676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:78e15a9f9609597836d5169a4ea98fefb54bd536dc4cf227a917316942f4a2d1","observation_id":"bde3d998-f1d2-439e-81b0-b4ea513ff99d","resolution":{"observed_at":"2026-07-03T01:07:30.567183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:2abbd6d2d574675ddaec5c71e633a1e604bc2c2dadac99604df29365a7b5cb18","observation_id":"25654b58-d96e-4671-8652-aa968b561f92","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:c7b9659c1e5c0681847067f12fb11fa4fe1ee9c417a15a0dc8317e6e4c6a2f32","observation_id":"772aef66-2622-46bf-bc52-8472bcf01f00","resolution":{"observed_at":"2026-07-03T01:07:30.572510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:38baac3c95559ff4e027ba8fc52fcf704de07812a8b2e6cfaee1e921cc0048c4","observation_id":"2c620fc0-0f46-4464-9f37-b7aac75ab450","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2405.18991","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:07:30.519228Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture","venue":null,"work_id":"a3246ab3-9adf-43d2-94c0-e47d8948f9c5","year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:4c530417c8f77e9a97737baacfe6394abc2ea1f2089ccde394666994de6357bd","observation_id":"d40fa7fe-c78f-4370-b058-7b51833433ea","resolution":{"observed_at":"2026-07-03T01:07:30.520717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15458","last_updated":"2024-10-20T17:51:35Z","snapshot_observed_at":"2026-07-06T19:36:41.445591Z","submitted_at":"2024-10-20T17:51:35Z","title":"Allegro: Open the Black Box of Commercial-Level Video Generation Model","version":1},"cited_work":{"arxiv_id":"2410.15458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15458","snapshot_observed_at":"2026-07-03T23:59:06.234618Z","title":"Allegro: Open the black box of commercial-level video generation model","venue":null,"work_id":"2a9fb750-b69a-4cb3-bd82-2a77e49bd173","year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2410.15458","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:5f00595ede22507057518d7a19a1455f5c7fb8950dba5ed96dd83a80cda0710d","observation_id":"941cf920-cc9c-4ca0-a84e-c8418149e6d3","resolution":{"observed_at":"2026-07-03T01:07:30.587853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08453","last_updated":"2025-01-14T21:53:11Z","snapshot_observed_at":"2026-07-06T20:21:09.148018Z","submitted_at":"2025-01-14T21:53:11Z","title":"Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models","version":1},"cited_work":{"arxiv_id":"2501.08453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08453","snapshot_observed_at":"2026-07-04T13:19:51.141627Z","title":"Vchitect-2.0: Parallel transformer for scaling up video diffusion models.arXiv preprint arXiv:2501.08453","venue":null,"work_id":"4bed9bae-f24a-4316-9d52-06cda3f3fcd7","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2501.08453","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:69c2da481fdbfc65b5e0cc2f74a28228348be58a4f3fa15e22df0b1f67c81678","observation_id":"39441c36-f316-4f64-a979-41fe82e66c8a","resolution":{"observed_at":"2026-07-03T01:07:30.541086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:361ccd48048bc5c8d48e1346b136e467bcf59265bdb64d4017e57d6d759966a3","observation_id":"4160614a-c9df-4a8d-9c4c-0b1bbe7606f6","resolution":{"observed_at":"2026-07-03T01:07:30.544795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:cb3d185ec954371c007bde309827f773211715524c2c4edf09e4d852fcf0cb7b","observation_id":"e699419d-b1f0-45fe-aa22-d3e4ae3e8815","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion.Advances in Neural Information Processing Systems, 37:24081–24125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:4350951a9e8daf8f4008cd7a09fb706c477b9a81a8bdf8e1cd6e668006f5eb69","observation_id":"4cfd1af3-9154-4fd6-ad6f-5754a72e1ca7","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-07-06T17:48:41.389936Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":"2403.14773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-07-03T01:07:30.540936Z","title":"Streamingt2v: Con- sistent, dynamic, and extendable long video generation from text","venue":null,"work_id":"23ab722b-7b7e-495e-9a48-406d9f96640b","year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:2146866779c7c756ededb13d702e906719fe855ee73e84e88c84044d50525016","observation_id":"377a522c-dfb8-4440-87e6-72d18c27457d","resolution":{"observed_at":"2026-07-03T01:07:30.542544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":"2503.19325","doi":"10.48550/arxiv.2503.19325","metadata_source":"pith","pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","venue":"cs.CV","work_id":"9700bbdc-df42-461a-81fa-b29ffe683326","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:2c37ef43ecfce4d09d5c0c7433cb69a17454c5d08826aa29e17e0d7f7c274c99","observation_id":"fabb33da-7002-44be-8caa-def0bde54458","resolution":{"observed_at":"2026-07-03T01:07:30.539762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":"2504.13074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-07-10T01:46:41.058772Z","title":"SkyReels-V2: Infinite-length Film Generative Model","venue":"cs.CV","work_id":"2ce11350-273e-4f0d-ae78-292aa3151060","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:04e539cf01793b3cc946f343d08dff89496942a4a78963b25b820a2fc63bc832","observation_id":"187ec094-66b8-4342-93d5-403816e3d79f","resolution":{"observed_at":"2026-07-03T01:07:30.518085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08151","last_updated":"2025-05-18T06:43:40Z","snapshot_observed_at":"2026-07-06T19:31:18.802964Z","submitted_at":"2024-10-10T17:36:15Z","title":"Progressive Autoregressive Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2410.08151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.08151","snapshot_observed_at":"2026-07-03T01:07:30.542292Z","title":"arXiv preprint arXiv:2410.08151 , year=","venue":null,"work_id":"a5743ec3-75d5-42c2-a60f-4067e506dc8c","year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2410.08151","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:e5e696d5dfcb62a5e0092796dd93acc5cc37f618b53a77349f4f098976b92163","observation_id":"0e731683-2faf-4f13-b001-80924ee332b3","resolution":{"observed_at":"2026-07-03T01:07:30.543766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2404.02101","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-07-10T01:46:41.167891Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","venue":"cs.CV","work_id":"1c05c278-c023-4ef0-a359-25a41f1065eb","year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:cf167ed8ce887ca6a839deb91fb3eb34bf435bb90341a7e0e4f3dfe3a1d07e8c","observation_id":"35027349-0290-4749-8a70-06ceedc5da22","resolution":{"observed_at":"2026-07-03T01:07:30.549908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10592","last_updated":"2025-03-13T17:42:01Z","snapshot_observed_at":"2026-07-06T20:52:09.743730Z","submitted_at":"2025-03-13T17:42:01Z","title":"CameraCtrl II: Dynamic Scene Exploration via Camera-controlled Video Diffusion Models","version":1},"cited_work":{"arxiv_id":"2503.10592","doi":"10.48550/arxiv.2503.10592","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10592","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Cameractrl ii: Dynamic scene exploration via camera-controlled video diffusion models","venue":null,"work_id":"16b7fb48-eb39-4b7f-bf7c-9b57914e2dce","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2503.10592","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:a053d44b8b3bcafa2a6fe645f56e855b50dcc31e739c7b81c7ab638aec25f638","observation_id":"dc8ed5b7-74df-4ee6-a82c-351fb092dda7","resolution":{"observed_at":"2026-07-03T01:07:30.531837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:24:40.331398+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:24:40.331398+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06525","last_updated":"2025-02-28T06:40:38Z","snapshot_observed_at":"2026-07-06T19:48:05.525731Z","submitted_at":"2024-11-10T16:59:39Z","title":"I2VControl-Camera: Precise Video Camera Control with Adjustable Motion Strength","version":3},"cited_work":{"arxiv_id":"2411.06525","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.06525","snapshot_observed_at":"2026-07-04T16:29:56.755566Z","title":"arXiv preprint arXiv:2411.06525 , year=","venue":null,"work_id":"14ad5efd-d959-4af1-9c8d-8a699d4a29ab","year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2411.06525","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:f2a8692443747fc4e5cd35f1865f200e6b7b7ab1a7dbd04fb30136324d7f4c3a","observation_id":"49510953-c288-47e1-b79f-ce600acd1d4f","resolution":{"observed_at":"2026-07-03T01:07:30.504853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Panflow: Decoupled motion control for panoramic video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:a81c4c131ef9e5bf557455b7c94a279f59ac7c0cee91cd3a4718282920242430","observation_id":"ca2910c8-f94a-405a-a6a1-3a3d187a12b4","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02048","last_updated":"2024-09-03T16:53:19Z","snapshot_observed_at":"2026-07-06T19:09:55.393720Z","submitted_at":"2024-09-03T16:53:19Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","version":1},"cited_work":{"arxiv_id":"2409.02048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02048","snapshot_observed_at":"2026-07-07T14:03:48.606626Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","venue":"cs.CV","work_id":"af2e8736-e001-407f-b94e-21e98f89ec55","year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2409.02048","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:0734e3ce298c8105b7270a3842389f0c24a6ca6043ff1e428daa488977a56eeb","observation_id":"6ae2c67d-b19a-4f0a-9fe2-ed851ec43425","resolution":{"observed_at":"2026-07-03T01:07:30.547536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14489","last_updated":"2025-04-01T18:22:54Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:22Z","title":"Stable Virtual Camera: Generative View Synthesis with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2503.14489","doi":"10.48550/arxiv.2503.14489","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14489","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arc left","venue":null,"work_id":"72bba5bf-fe95-4b18-8c99-5742ab45bc25","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2503.14489","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:0578cf0e55dcbf9164663afe2cd3b255ac8b48e63c4b83c3e9b49c5b194d82a2","observation_id":"3596fd8e-bc4f-46ed-b64f-1f6c770255ec","resolution":{"observed_at":"2026-07-03T01:07:30.619192Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03847","last_updated":"2025-01-09T04:25:42Z","snapshot_observed_at":"2026-07-06T20:17:43.203959Z","submitted_at":"2025-01-07T15:01:58Z","title":"Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control","version":2},"cited_work":{"arxiv_id":"2501.03847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03847","snapshot_observed_at":"2026-07-04T00:09:14.791130Z","title":"arXiv preprint arXiv:2501.03847 (2025)","venue":null,"work_id":"2b6484b7-b532-4eb7-a7d9-45bc262bc16a","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2501.03847","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:eebc648713c856910d39e824b1c45965bef50b0c33087b09875a5835bb13c88d","observation_id":"87069452-d0db-4868-afda-6a7dd23a95c0","resolution":{"observed_at":"2026-07-03T01:07:30.525430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Gen3c: 3d-informed world- consistent video generation with precise camera control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:e2470e49634466e871b9ff499612a40f08f63d6ea334baa9b1c9bdcd284d7df9","observation_id":"e817054a-d947-4f19-840f-cf74bb56677e","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02312","last_updated":"2025-04-03T06:38:30Z","snapshot_observed_at":"2026-08-02T13:41:35.047989Z","submitted_at":"2025-04-03T06:38:30Z","title":"OmniCam: Unified Multimodal Video Generation via Camera Control","version":1},"cited_work":{"arxiv_id":"2504.02312","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02312","snapshot_observed_at":"2026-07-03T01:07:30.521413Z","title":"Omnicam: Unified multimodal video generation via camera control.arXiv preprint arXiv:2504.02312, 2025","venue":null,"work_id":"616e65be-b6f3-4167-afd5-9a13d3a61fe0","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2504.02312","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:2ffd92aa8dba9fec3d48918bfd10640ce083bc87141ef1f1e3e10dae3deb30e6","observation_id":"1e768aa3-a099-42f7-b544-72c934469877","resolution":{"observed_at":"2026-07-03T01:07:30.522986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Invisible stitch: Gener- ating smooth 3d scenes with depth inpainting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:e09f3e2dbed2402b930a8e4538455461f446da9b5b9105712daa72f2b9661890","observation_id":"fafee4b7-b81e-4000-9a0c-9b359056c179","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13265","last_updated":"2025-03-19T08:26:31Z","snapshot_observed_at":"2026-07-06T20:54:00.272496Z","submitted_at":"2025-03-17T15:18:38Z","title":"FlexWorld: Progressively Expanding 3D Scenes for Flexiable-View Synthesis","version":2},"cited_work":{"arxiv_id":"2503.13265","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13265","snapshot_observed_at":"2026-07-05T16:51:14.282275Z","title":"Flexworld: Progressively expanding 3d scenes for flexiable-view synthesis","venue":"cs.CV","work_id":"a1fe36bf-a902-4767-be84-e37081ae64e8","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2503.13265","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:a99ddd6766266e319c7dcfdbf976d7120b6df5dcd6cd9216dd09d05f36d76b3a","observation_id":"61e12937-678e-464e-afcd-2c530b8ceb1b","resolution":{"observed_at":"2026-07-03T01:07:30.605978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-07-06T21:36:01.328140Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:6899da65fe0d12848ee23d142d776aecc6c03674d89529ae291780ab08398dbd","observation_id":"99edf4a0-a104-4d72-b421-d62804aad845","resolution":{"observed_at":"2026-07-03T01:07:30.554029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.12369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:19:13.356094Z","title":"arXiv preprint arXiv:2504.12369 , year=","venue":null,"work_id":"7159175f-77a7-43d9-8dc3-54bda91b0e0b","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:33c38a7c1623b638a81494504b3b532f33c4d5d400f81ec2efacf1305fdac01d","observation_id":"9143008a-ce83-41c2-a166-c05eb9be6cba","resolution":{"observed_at":"2026-07-03T01:07:30.558394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18903","last_updated":"2025-08-14T14:03:30Z","snapshot_observed_at":"2026-07-06T21:46:30.250293Z","submitted_at":"2025-06-23T17:59:56Z","title":"VMem: Consistent Interactive Video Scene Generation with Surfel-Indexed View Memory","version":3},"cited_work":{"arxiv_id":"2506.18903","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18903","snapshot_observed_at":"2026-07-03T17:58:47.750659Z","title":"Vmem: Consistent interactive video scene generation with surfel-indexed view memory","venue":null,"work_id":"8c6afc6c-7c32-41eb-87c1-e51bca941b63","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2506.18903","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:010f6b0bb7a18c802f6db3bad344ff37496ea924968e28d29a548bb06a056cc0","observation_id":"9abdcd1c-0cdf-44fa-acaa-293c453449d1","resolution":{"observed_at":"2026-07-03T01:07:30.579093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:ece924c8ec6426bb18595b5bf0be5d3a75d9ab7a6a9d33887b9243096dc83a70","observation_id":"72b7fa6e-ac9f-46c7-88a4-1e3697de5f75","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:75179cb8a5599914d2fff006df897189b6fa6a460427b871c5587951c79f2bdd","observation_id":"755c2684-9da0-48fa-85b6-2e309f7730ab","resolution":{"observed_at":"2026-07-03T01:07:30.611581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:05494bd63da044fd7c12c26c0b41708c04a05bc34975152ba3a0c7baa7f92cd7","observation_id":"0c52b5aa-e4d9-4bcb-b748-f4b85bdbb253","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"Flashworld: High-quality 3d scene generation within seconds, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:fc789708f5b496c718df6510ee2551cac1212f5520c8e3f7560a7a51c393f7cb","observation_id":"3f5ae6b8-2c0f-41fd-a41b-0878963dc1fa","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13384","last_updated":"2023-11-23T11:40:16Z","snapshot_observed_at":"2026-07-06T16:51:06.781541Z","submitted_at":"2023-11-22T13:27:34Z","title":"LucidDreamer: Domain-free Generation of 3D Gaussian Splatting Scenes","version":2},"cited_work":{"arxiv_id":"2311.13384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.13384","snapshot_observed_at":"2026-07-04T13:49:51.650606Z","title":"Luciddreamer: Domain-free gen- eration of 3d gaussian splatting scenes","venue":null,"work_id":"24a684d2-afbc-461d-9ff8-92fa3c51ff4c","year":2023},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2311.13384","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:fb2083d0ade080a5184c5369613255a2098c3b7d84deb735e7bc709255721400","observation_id":"7e81dedf-a950-40b1-887b-18fc933ec81d","resolution":{"observed_at":"2026-07-03T01:07:30.520332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10934","last_updated":"2025-08-12T18:39:13Z","snapshot_observed_at":"2026-07-06T22:13:09.586800Z","submitted_at":"2025-08-12T18:39:13Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","version":1},"cited_work":{"arxiv_id":"2508.10934","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.10934","snapshot_observed_at":"2026-07-04T13:29:51.199853Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","venue":"cs.CV","work_id":"2d60e542-3c1c-4656-becc-ded522856631","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2508.10934","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:dc2808794e0fe1ec96c886b575cdf838c0e492cf36c02dacbb9042229230d0da","observation_id":"fdea7b39-f900-4423-9899-f08518edf7b8","resolution":{"observed_at":"2026-07-03T01:07:30.512664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.13414","last_updated":"2026-01-23T18:59:33Z","snapshot_observed_at":"2026-07-06T22:30:07.020487Z","submitted_at":"2025-09-16T18:00:14Z","title":"MapAnything: Universal Feed-Forward Metric 3D Reconstruction","version":3},"cited_work":{"arxiv_id":"2509.13414","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.13414","snapshot_observed_at":"2026-07-09T18:46:26.573653Z","title":"MapAnything: Universal Feed-Forward Metric 3D Reconstruction","venue":"cs.CV","work_id":"cb742a0f-0648-4cb0-904b-180184987f6b","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2509.13414","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:5c0edcd50091efa419a3ddc4690e3f5dac17f3b40d29d9f089c006817f181e63","observation_id":"ed825fd4-ae90-4e6f-b90c-f023deb7e3f6","resolution":{"observed_at":"2026-07-03T01:07:30.534308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"UniDepth: Universal monocular metric depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:75c124c336f374f5d9de7d6fef198ffd7a7537434d7ce036a739a6ca614350bb","observation_id":"53544648-4499-4378-bab4-66804870607f","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:47:42.761342Z","title":"hole rate","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:b4423c9d8c1c8d28b3445270129f24628b216473f028e64fa7c5097060a1d80c","observation_id":"1faff4ad-7a8f-40bf-991e-dafb66ab7587","resolution":{"observed_at":"2026-06-27T16:47:42.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":22,"verified_exact":40,"verified_fuzzy":0},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 1 inbound Pith citation observation for arXiv:2606.09828."}