{"as_of":"2026-08-04T21:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba2b1c8f773b24d1d555af79efd5cf011c5f0039c88349a4d31505fa33a5fd79","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T04:27:43.019940Z","state":"measured"},{"denominator":110,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":110,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":62,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T02:03:06.559801Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"reference_index":294,"source":"arxiv_source","source_observed_at":"2026-05-20T13:03:57.828598Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2308.08089"},"observation_digest":"sha256:d391e50b5943cd33050c08ae1e33a820bdd6536f72ed6386f448644411f69c53","observation_id":"9f168b6b-cb29-4ebb-9a6c-c29f0072eed4","resolution":{"observed_at":"2026-05-20T13:03:58.052961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"reference_index":197,"source":"arxiv_source","source_observed_at":"2026-05-16T02:15:18.265190Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2310.06114"},"observation_digest":"sha256:199165135bbb32374d2cd4be576ea8a8602b03ff857bb4942416df31668761f3","observation_id":"428475e6-c378-428a-8592-b57f1e3e2cba","resolution":{"observed_at":"2026-05-16T02:15:18.708576Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-07-06T16:40:28.142296Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T21:40:43.956642Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2310.19512"},"observation_digest":"sha256:7dfc385aa4c2f7ace95433c8c0e95ea3a422a04ffbb2ccdaa744cea18aceeaaf","observation_id":"32643e5b-0e18-4cc9-a7f7-e855f7f6fa4f","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T17:51:05.465548Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2312.14125"},"observation_digest":"sha256:5dbbdfeb1dfcd23c04a802a461dfb1ac8c75c753d085d5de641668e4a2594e9d","observation_id":"261cd0ef-3c62-48da-b345-be20ab3e4c9b","resolution":{"observed_at":"2026-05-15T17:51:05.701564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T21:45:35.754742Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2401.03048"},"observation_digest":"sha256:132d89660cb39bf446f5480004afdb68259f8d68072917eb278f0952edd9803c","observation_id":"33a870af-4fa5-4ccf-987a-4bf1aecff61e","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-13T02:06:23.410241Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2404.02101"},"observation_digest":"sha256:8b9b5039d8d368712494bf066cdc3abf39725a059d319f1c3e174fc233959211","observation_id":"7729b9c3-8265-4d50-89ea-901905515137","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-16T12:00:14.672729Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2502.06764"},"observation_digest":"sha256:e8b9429c226e5e8497218374ce2f83f56e057e32a423acea275eb2fd857903d7","observation_id":"934fedbb-abfd-4ded-90c9-0d1d7aaaff0d","resolution":{"observed_at":"2026-05-16T12:00:14.720563Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2503.06310","last_updated":"2026-05-19T15:23:11Z","snapshot_observed_at":"2026-08-02T11:19:30.638087Z","submitted_at":"2025-03-08T19:04:36Z","title":"Scene-Action Prompt Fusion for Coherent Text-to-Video Storytelling","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T00:07:39.286486Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2503.06310"},"observation_digest":"sha256:a1639fe8887b7764f4183c2c1a271aaeaf3590ad9bdec063cf51e10737d3e41b","observation_id":"413fb7db-927b-479c-8779-efaa3d1e1d75","resolution":{"observed_at":"2026-05-23T00:12:17.911039Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T23:05:17.201790Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2503.19325"},"observation_digest":"sha256:319f59150371b1a914f3b8a9ddcebc7bfcf9872b6d68dc521c133d3e3fb011e5","observation_id":"de86f5b8-bfbd-43cc-b490-d3abe0895a86","resolution":{"observed_at":"2026-05-16T23:05:17.343915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:bac0be48d057abd95eeb14b3c2d26b265ad853a802c33787c6422bd34fb90799","observation_id":"2116d735-d45d-4b37-9f38-714c5765e739","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2504.17180","last_updated":"2026-04-03T02:52:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-24T01:34:12Z","title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T18:56:39.735334Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2504.17180"},"observation_digest":"sha256:ed9c182ce1f27f34a0fd0663fe7e90cec1760e887a0f2381856f4eaa5b40a8a4","observation_id":"992392b5-918c-4b6b-9832-ff0856f506a8","resolution":{"observed_at":"2026-05-22T18:56:58.188352Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:0e480f7614af13dba1130ed7110d4516695833479b6c99f586f3e78c36b6c40d","observation_id":"88c9db44-0f5c-4ae6-8a78-fb3a60c06803","resolution":{"observed_at":"2026-05-22T17:51:54.699920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2505.16819","last_updated":"2026-05-19T15:22:52Z","snapshot_observed_at":"2026-08-01T07:12:14.758494Z","submitted_at":"2025-05-22T15:54:42Z","title":"Character-Centered Dialogue Generation from Scene-Level Prompts","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T13:31:43.083678Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2505.16819"},"observation_digest":"sha256:26d29ac80276914a623db1bce43a0784755ab99ca1fa2cb5536848bb6efab681","observation_id":"ecd29aab-771d-4a91-b1cd-ca1b5936da55","resolution":{"observed_at":"2026-05-22T13:34:53.688203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2506.09981","last_updated":"2026-04-28T09:28:14Z","snapshot_observed_at":"2026-08-02T12:46:46.614409Z","submitted_at":"2025-06-11T17:55:05Z","title":"ReSim: Reliable World Simulation for Autonomous Driving","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-19T09:28:00.597160Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2506.09981"},"observation_digest":"sha256:3d4dec7df809255b5f61d5a8a41b466aeb0f17c8f88195c9a25239d44b424fda","observation_id":"09ea2d98-83d3-4510-bca7-ec060d697bd7","resolution":{"observed_at":"2026-05-19T09:32:16.828630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-15T03:52:59.287555Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2509.22622"},"observation_digest":"sha256:92948f2387fe87ed3fc825521b6dd7a5471afebb1816bc7cefdc0af3e2f24ef5","observation_id":"eaa1421a-0b24-4362-999d-4c425155937d","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-02T07:40:05.046770Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T22:39:53.995700Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2510.02283"},"observation_digest":"sha256:e783104fe54166ca16fb6ee6d799066c5b4fb4813484a6f9092006099773ce42","observation_id":"b1aac2db-3687-4d5a-8b90-1a8b0db11be1","resolution":{"observed_at":"2026-05-15T22:39:54.363532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-03T20:16:10.700777Z","title":"Latent video diffusion models for high-fidelity long video generation.arXiv preprint arXiv:2211.13221,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20562","last_updated":"2026-06-26T07:28:21Z","snapshot_observed_at":"2026-08-03T20:16:09.429548Z","submitted_at":"2025-11-25T17:59:04Z","title":"PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T20:16:10.700777Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2511.20562"},"observation_digest":"sha256:fdd5de219f6fa7e687bc0edfdb30e1083dfaac81afeb53274fdbb8df7dc18f10","observation_id":"deab3c25-dfc0-4b2a-ba3a-c2cad342d100","resolution":{"observed_at":"2026-08-03T20:16:10.700777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2511.22940","last_updated":"2026-05-19T15:28:34Z","snapshot_observed_at":"2026-08-02T05:15:20.627790Z","submitted_at":"2025-11-28T07:30:10Z","title":"One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T18:25:22.486891Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2511.22940"},"observation_digest":"sha256:e7efbf423ed9a8e67b231f01a50d9856ecf9db7edcd0e3637159df7f41b87073","observation_id":"89b64457-1fbd-4b27-a665-69424aa90faf","resolution":{"observed_at":"2026-05-21T18:25:28.408268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2512.04678","last_updated":"2025-12-28T11:15:39Z","snapshot_observed_at":"2026-08-04T14:52:25.854038Z","submitted_at":"2025-12-04T11:12:13Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T18:17:54.943863Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2512.04678"},"observation_digest":"sha256:df16a0b6d80d98f95e33d6e0ab923bcf99b990a32049e1ceb8d55e1a97dddeae","observation_id":"b194084b-6822-45dd-b7a0-a29ac612efe8","resolution":{"observed_at":"2026-05-16T18:17:55.160442Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-03T13:24:44.948653Z","title":"Latent video diffusion models for high-fidelity long video generation.arXiv preprint arXiv:2211.13221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24551","last_updated":"2026-06-18T22:13:10Z","snapshot_observed_at":"2026-08-03T13:24:41.191940Z","submitted_at":"2025-12-31T01:19:14Z","title":"PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T13:24:44.948653Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2512.24551"},"observation_digest":"sha256:02b4a9fa59a0107df3dfa63306138dd1590ce5c0b2cb856aaefa2d7506ce4961","observation_id":"db4586ce-4d76-40cd-b3ad-edf60a73133c","resolution":{"observed_at":"2026-08-03T13:24:44.948653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-03T07:20:49.551065Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.20904","last_updated":"2026-06-21T14:45:23Z","snapshot_observed_at":"2026-08-03T07:20:47.278469Z","submitted_at":"2026-01-28T12:13:00Z","title":"ECGFlowCMR: Pretraining with ECG-Generated Cine CMR Helps Cardiac Disease Classification and Phenotype Prediction","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T07:20:49.551065Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2601.20904"},"observation_digest":"sha256:926e89d734edcbff677a2259a4c246ea9eccde9fae737d633caa68b42eae22e1","observation_id":"caf7661c-9135-442e-9168-eb3b9cabe2f1","resolution":{"observed_at":"2026-08-03T07:20:49.551065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T17:32:01.642256Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2602.02214"},"observation_digest":"sha256:15bc6e909cb9c2beb6f271c088eaf06a467c53091cfb504c168aee824dbe5503","observation_id":"79439f67-d10a-4166-abcd-2e7af53fb81f","resolution":{"observed_at":"2026-05-21T17:32:01.727325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T11:48:00.633421Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2602.02214"},"observation_digest":"sha256:3c7602518c24294101664599a07392cadf548180cc37f96059d7ebff9ccbddc4","observation_id":"2d7cda25-8880-447d-9621-d2618b676636","resolution":{"observed_at":"2026-05-22T11:51:29.870392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-03T05:30:25.387441Z","title":"La- tent video diffusion models for high-fidelity long video generation.arXiv preprint arXiv:2211.13221,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T05:30:25.387441Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2602.02214"},"observation_digest":"sha256:2cd8b28cacee6bd2832279ad1c8670960513f1d59b84d67ab856dd6660d6b623","observation_id":"01c081ac-9f31-4fe2-93c2-30c81ee7a561","resolution":{"observed_at":"2026-08-03T05:30:25.387441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2603.03066","last_updated":"2026-05-19T02:39:43Z","snapshot_observed_at":"2026-07-31T20:59:59.870316Z","submitted_at":"2026-03-03T15:05:27Z","title":"EduVQA: Towards Concept-Aware Assessment of Educational AI-Generated Videos","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T11:52:09.262497Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2603.03066"},"observation_digest":"sha256:68a81ab61faa60891833f82c26e73e231fdbfd95a720f42085203a93ea1407f6","observation_id":"7f151000-3b07-4e49-905d-5d35120e0a74","resolution":{"observed_at":"2026-05-21T11:54:09.091230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2603.09721","last_updated":"2026-04-18T11:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-10T14:28:32Z","title":"FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T13:27:23.641294Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2603.09721"},"observation_digest":"sha256:6b3f3088b01328f378a0332e53bfc881a6460728c3687d3a626c2415a5ddb9d2","observation_id":"7a3117ba-00d2-4b67-8549-d3787457a6ab","resolution":{"observed_at":"2026-05-15T13:30:01.667460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2603.17812","last_updated":"2026-04-07T18:00:52Z","snapshot_observed_at":"2026-07-06T22:49:33.482934Z","submitted_at":"2026-03-18T15:04:57Z","title":"ChopGrad: Pixel-Wise Losses for Latent Video Diffusion via Truncated Backpropagation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T09:42:26.074609Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2603.17812"},"observation_digest":"sha256:eccef47a667e5d77c4e0a09e969074506507d1b7b766ed653bce8d98b1fae35c","observation_id":"594cfcaf-3a4c-42e4-8b0b-656bcdc5b80a","resolution":{"observed_at":"2026-05-15T09:45:23.278176Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2604.02979","last_updated":"2026-04-03T11:34:47Z","snapshot_observed_at":"2026-08-03T11:27:47.492544Z","submitted_at":"2026-04-03T11:34:47Z","title":"Not All Frames Deserve Full Computation: Accelerating Autoregressive Video Generation via Selective Computation and Predictive Extrapolation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T20:43:39.554490Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2604.02979"},"observation_digest":"sha256:45d6e6aaa09bc0f00dd8abb8d5b0e5442838caab9c638191f6e581674eb3815b","observation_id":"900758df-949c-4cf2-8512-f0f939aa615e","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:aacfb3ec99ef633ad876e188eaba8539de991cafde33c4348c72b8e12a08e110","observation_id":"4a8cb0c3-0b9d-4956-8308-5a2ac83f73eb","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2604.07026","last_updated":"2026-04-08T12:45:21Z","snapshot_observed_at":"2026-07-06T22:55:24.459130Z","submitted_at":"2026-04-08T12:45:21Z","title":"Not all tokens contribute equally to diffusion learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T18:55:51.020912Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2604.07026"},"observation_digest":"sha256:759e9ce0585aa229374e14244f6e5632f0f713698170d1635bedca80a5028d8e","observation_id":"c5e14473-811e-458e-aaf1-9e0dcef51d06","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2604.10578","last_updated":"2026-04-14T11:24:24Z","snapshot_observed_at":"2026-08-02T13:49:44.275069Z","submitted_at":"2026-04-12T10:55:14Z","title":"Rein3D: Reinforced 3D Indoor Scene Generation with Panoramic Video Diffusion Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:15.916685Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2604.10578"},"observation_digest":"sha256:94ec19653b1d41694e963834fdf867a64257bc1e06fd071b603437bd0da039a1","observation_id":"1f951631-eaf1-4246-8576-d807e624166e","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:88c5b0b8c66296f494e9e7fcb67f379ac0197d79eaeced17aed8e98c405a9678","observation_id":"1bbd024e-894b-43f5-b5e7-da543e2c230c","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":291,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:5b684636984159e943637460ded98c5f477c604c8bd06516b7230629ceee348d","observation_id":"55b9af03-997d-4a59-a771-e1fbca5d5d36","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:1829247301a26b09396bebad6b9663c3e994ec6593dc98b6b3d9557020e2ec99","observation_id":"1f1b6ae9-bb4e-4dc1-b469-8e31eb10843c","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2604.17749","last_updated":"2026-04-20T03:07:22Z","snapshot_observed_at":"2026-08-02T07:17:07.517645Z","submitted_at":"2026-04-20T03:07:22Z","title":"Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T05:26:48.606759Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2604.17749"},"observation_digest":"sha256:149bc3b7bbd2b983fede43ab564717d4275163e8abc4a8e0918617d4471154ce","observation_id":"7b454bea-9469-4959-9e58-8f8967485673","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:d9abfdce0e3264e06d39acc27c18b1a8602db6a6db921d32bc8ae9cd753aecc2","observation_id":"a4343819-02f6-4907-845f-a29e5d72e5b8","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2604.26232","last_updated":"2026-04-29T02:24:28Z","snapshot_observed_at":"2026-08-01T02:56:18.432166Z","submitted_at":"2026-04-29T02:24:28Z","title":"DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T14:07:52.387781Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2604.26232"},"observation_digest":"sha256:8c129bc023a1fdfc2483389ced966a42864c196702319030f910c2427a43d84c","observation_id":"6cd28b96-c5b2-4070-9cf4-e784f55610ef","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2605.06512","last_updated":"2026-05-07T16:22:21Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T16:22:21Z","title":"DCR: Counterfactual Attractor Guidance for Rare Compositional Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T13:06:56.964670Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2605.06512"},"observation_digest":"sha256:674b839fa2a0bae05fec6b404f49210762bccd0e50a6c3c76939a4d7375f8834","observation_id":"28e4e1a3-7fcf-4207-a900-01ffc6b1e623","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2605.09275","last_updated":"2026-05-10T02:53:43Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T02:53:43Z","title":"DiffATS: Diffusion in Aligned Tensor Space","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T04:38:12.633086Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2605.09275"},"observation_digest":"sha256:302d8c154a030f9e8997e513b8931291f24722bcd0fa355f72154655ffb65f8d","observation_id":"5eb3b571-ca24-4a86-b3b5-72206a1f72b8","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2605.09442","last_updated":"2026-05-10T09:37:56Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T09:37:56Z","title":"SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T04:57:38.215348Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2605.09442"},"observation_digest":"sha256:a98d7e06b84733ed8779cdfdf47297d00c525fab52541e9bd914e9e766f1a0a4","observation_id":"e28973e7-9744-4f86-bec3-13e5093f27d1","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2605.12431","last_updated":"2026-05-12T17:27:56Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:27:56Z","title":"GaitProtector: Impersonation-Driven Gait De-Identification via Training-Free Diffusion Latent Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T06:38:08.198271Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2605.12431"},"observation_digest":"sha256:5040ddb8701b7a77643c2600e4517699cdfa8c3be697e7ecf33bc517a97e2be4","observation_id":"d51d9b99-bfed-4856-a304-ebebccb03044","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2605.13775","last_updated":"2026-05-13T16:54:36Z","snapshot_observed_at":"2026-07-06T23:25:16.229144Z","submitted_at":"2026-05-13T16:54:36Z","title":"RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-14T17:54:50.325820Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2605.13775"},"observation_digest":"sha256:c67aeba4bccdbd295587913fa0bd88c1edb9e0532ab7692017a045af8c7b7f5b","observation_id":"8c3de530-83d2-4fd3-be2d-e466a2cf955f","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2605.14136","last_updated":"2026-05-13T21:39:50Z","snapshot_observed_at":"2026-07-06T23:25:34.835136Z","submitted_at":"2026-05-13T21:39:50Z","title":"TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T04:59:34.046044Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2605.14136"},"observation_digest":"sha256:2783fee88fcb0441ae7a32637bed4ce8504c7d5e4213abf6ead6f1b959da53ce","observation_id":"9ce9627a-2952-42e6-9595-e5268d90525f","resolution":{"observed_at":"2026-05-15T04:59:44.883744Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2605.16530","last_updated":"2026-05-20T08:53:25Z","snapshot_observed_at":"2026-08-02T09:05:27.991879Z","submitted_at":"2026-05-15T18:27:29Z","title":"SWoMo: Neuro-Symbolic World Model for Cataract Surgery Simulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T18:13:41.075019Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2605.16530"},"observation_digest":"sha256:01fafe30f243dff7730a39fa7318c5b82b25fa6ac5eea582cf68e9cfd2f7fea4","observation_id":"b04a9df0-9d2a-4aab-a07a-be25fe16c759","resolution":{"observed_at":"2026-05-20T18:13:49.910147Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2605.16530","last_updated":"2026-05-20T08:53:25Z","snapshot_observed_at":"2026-08-02T09:05:27.991879Z","submitted_at":"2026-05-15T18:27:29Z","title":"SWoMo: Neuro-Symbolic World Model for Cataract Surgery Simulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T07:37:30.564219Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2605.16530"},"observation_digest":"sha256:a5866df8cc49bdaed720ea8c89e465e0119449bc5e7fe36616282fb2fe811165","observation_id":"7c198bdd-ed73-4c6a-b069-31deeae30b4d","resolution":{"observed_at":"2026-05-21T07:39:49.147698Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2606.08674","last_updated":"2026-06-24T14:20:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-07T15:23:49Z","title":"BioVid: Autoregressive Video Generation with Biological Behavior Semantic Comprehension","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T18:35:14.331659Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2606.08674"},"observation_digest":"sha256:52e8be30ce3bcb779cc40611b26987faab6636511d48f50ed03d4dcfd708fb80","observation_id":"951ad195-9348-42a8-9201-538d34bdb030","resolution":{"observed_at":"2026-06-27T18:41:07.973397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2606.20110","last_updated":"2026-06-18T11:34:26Z","snapshot_observed_at":"2026-08-01T19:05:47.270913Z","submitted_at":"2026-06-18T11:34:26Z","title":"FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation with Parameter-Free Frozen Diffusion Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T18:34:56.810124Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2606.20110"},"observation_digest":"sha256:4db2ced8fd16bc8459e71e1e3c9a1709420180f76ef405c8e94bddc2e85e279c","observation_id":"c86213ee-e3de-45e3-9a60-be11b1119c9f","resolution":{"observed_at":"2026-07-04T02:59:26.696859Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2606.21172","last_updated":"2026-06-19T07:24:32Z","snapshot_observed_at":"2026-07-06T23:56:12.374739Z","submitted_at":"2026-06-19T07:24:32Z","title":"BadDreamer: Transferable Backdoor Attacks against Video World Models for Autonomous Driving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:21.711927Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2606.21172"},"observation_digest":"sha256:234c0da649b80004402d36b474b6e7d9066ba346e07d467c345714e106302b79","observation_id":"5502ceee-b152-4eab-84c3-c19ec7b2be80","resolution":{"observed_at":"2026-07-04T06:29:37.009737Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2606.22370","last_updated":"2026-06-21T07:39:37Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T07:39:37Z","title":"Towards Error-Free Long Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T10:49:36.838492Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2606.22370"},"observation_digest":"sha256:f5893275e1a5aee367e190ecc6ef1f31dde2486e2cb15be4003ee3eb3a0de1a4","observation_id":"6186abd7-a112-4715-8dba-1c69cd73a535","resolution":{"observed_at":"2026-07-04T08:59:42.093150Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-02T10:00:07.442935Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T02:03:45.564122Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:3944e91fbd25553724b99bfe825f8e06c6af8a2bdfe2af8227779e2b9f635858","observation_id":"7a1f019e-cdf1-4611-9645-4450ea856a45","resolution":{"observed_at":"2026-07-01T18:25:57.829021Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-02T10:00:07.442935Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T06:25:58.872140Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:d3261941d4b6bd4808a1bcb649a7e63752f7e5e1ae4c135f7e8e5a12150d7fae","observation_id":"fe339ba0-9a28-4db0-bd04-338433e3ad2b","resolution":{"observed_at":"2026-07-01T09:35:40.662738Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-02T10:00:07.442935Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-02T20:52:28.444524Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:6b2e25be0447e5d63dc69c0358a5b56cc04a3ce7080fe61692a4b70784b05207","observation_id":"305a1e84-1b94-47c1-a6fa-60693199f25c","resolution":{"observed_at":"2026-07-02T20:57:22.811299Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-02T10:00:07.442935Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-03T22:44:16.272541Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:924ec4e89b22564da2226666e26593f91e12ccd35698bc284a83269c7b7746fa","observation_id":"3b1d1705-30a5-4d41-8aa0-b68725eda776","resolution":{"observed_at":"2026-07-03T22:49:00.836835Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-14T17:14:19.770867Z","title":"arXiv preprint arXiv:2211.13221 (2022) 3","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-02T10:00:07.442935Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T17:14:19.770867Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:95c4224557f57457a1eb2957bb716950e2ed577bef9f7f10670f131c1025f671","observation_id":"d1d0a197-e6f9-4391-b129-047bfedae003","resolution":{"observed_at":"2026-07-14T17:14:19.770867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-02T10:00:10.432760Z","title":"arXiv preprint arXiv:2211.13221 (2022) 3","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-02T10:00:07.442935Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T10:00:10.432760Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:1fef0e71093b094aa23ac205e2f0ddf35dc84fd6cccb40953639b3899906211d","observation_id":"5e098839-b3ad-4da2-b6a4-9b2ad9dc40a4","resolution":{"observed_at":"2026-08-02T10:00:10.432760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2607.01499","last_updated":"2026-07-30T22:02:39Z","snapshot_observed_at":"2026-08-04T21:11:13.528989Z","submitted_at":"2026-07-01T22:00:18Z","title":"Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-03T20:57:06.512365Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2607.01499"},"observation_digest":"sha256:077a0315d47fafb57b0845e344b002dc0cbeb3b4910754fcf7d51cbba086c451","observation_id":"42a795b7-302f-47e8-991c-612f634a82fc","resolution":{"observed_at":"2026-07-03T20:58:57.227521Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-12T08:45:35.247511Z","title":"arXiv preprint arXiv:2211.13221 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.01499","last_updated":"2026-07-30T22:02:39Z","snapshot_observed_at":"2026-08-04T21:11:13.528989Z","submitted_at":"2026-07-01T22:00:18Z","title":"Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T08:45:35.247511Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2607.01499"},"observation_digest":"sha256:264e998b49ce6741406188c04ee52989461cd3400c6549414fb37e25506f63ed","observation_id":"bf7baa2e-7207-4377-bf41-c22cac98f082","resolution":{"observed_at":"2026-07-12T08:45:35.247511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-03T02:03:41.757942Z","title":"arXiv preprint arXiv:2211.13221 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.01499","last_updated":"2026-07-30T22:02:39Z","snapshot_observed_at":"2026-08-04T21:11:13.528989Z","submitted_at":"2026-07-01T22:00:18Z","title":"Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T02:03:41.757942Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2607.01499"},"observation_digest":"sha256:b785b10a74953e396d5da4d5928f56521c75c323cd1b4ddcff2bd5ac4c841c78","observation_id":"4a5e027a-51b0-43b0-8545-0c5d690da8d8","resolution":{"observed_at":"2026-08-03T02:03:41.757942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-02T00:24:05.483535Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15065","last_updated":"2026-07-16T14:37:43Z","snapshot_observed_at":"2026-08-02T17:16:02.070752Z","submitted_at":"2026-07-16T14:37:43Z","title":"DriftWorld: Fast World Modeling through Drifting","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T00:24:05.483535Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2607.15065"},"observation_digest":"sha256:dc9826d79c1372404002ac174de94be8a4c52f5333d59a0291ac5be3f100c7c3","observation_id":"8f62b9bc-c796-4f36-a325-4e60547d416f","resolution":{"observed_at":"2026-08-02T00:24:05.483535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-31T23:01:25.641610Z","title":"Latent video diffusion models for high-fidelity long video generation.arXiv preprint arXiv:2211.13221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-07-31T23:01:20.155120Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:25.641610Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:8cb5c2ee8e2e35ed2370ce738f819d3750dcf6d1a66c781781643635150d1462","observation_id":"1c52d0d4-c454-4593-aa29-0d65cf92c4df","resolution":{"observed_at":"2026-07-31T23:01:25.641610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-30T23:29:03.477170Z","title":"arXiv preprint arXiv:2211.13221 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26706","last_updated":"2026-07-29T09:52:20Z","snapshot_observed_at":"2026-08-03T10:55:37.719124Z","submitted_at":"2026-07-29T09:52:20Z","title":"TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-30T23:29:03.477170Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2607.26706"},"observation_digest":"sha256:babf48d8fd9bae1d428569ed73caf1419a745c106d6998910a44ecf0b2f921f5","observation_id":"9e3a7d97-e258-4ff9-8022-f76a67f9b683","resolution":{"observed_at":"2026-07-30T23:29:03.477170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-04T02:03:06.559801Z","title":"arXiv preprint arXiv:2211.13221 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00024","last_updated":"2026-07-10T07:15:11Z","snapshot_observed_at":"2026-08-04T21:19:16.380796Z","submitted_at":"2026-07-10T07:15:11Z","title":"Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T02:03:06.559801Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2608.00024"},"observation_digest":"sha256:75291b32ff2584ac14c12d30c2177cf84e78bc2f865542f0934ba0d89575fb00","observation_id":"10c71744-417e-47d7-b79a-5ac082086605","resolution":{"observed_at":"2026-08-04T02:03:06.559801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2211.13221/citation-record","integrity":"/paper/2211.13221/integrity","json":"/paper/2211.13221/citation-record.json","paper":"/paper/2211.13221"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large scale GAN training for high ﬁdelity natural image synthesis","venue":null,"work_id":"af262cdc-3bc5-47cd-8871-360f893535c0","year":2019},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:02501a97450f08a9c8d64f8d26b2cc96e5d30da9c5f54a1fbde1b62c9e775398","observation_id":"139c04f7-13dd-4bb5-9a07-acb848aa6f1b","resolution":{"observed_at":"2026-05-15T04:27:43.470825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03429","last_updated":"2022-06-09T06:24:12Z","snapshot_observed_at":"2026-08-04T00:54:14.266317Z","submitted_at":"2022-06-07T16:29:51Z","title":"Generating Long Videos of Dynamic Scenes","version":2},"cited_work":{"arxiv_id":"2206.03429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03429","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Karras, Tero , year =","venue":null,"work_id":"443f47a8-d87d-4758-80b8-84e5a8c0f8b4","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2206.03429","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:2f9e230f1978263c4c9daf78d7ee6c8ddf4e4683240dc0c45ca3f3663109ec19","observation_id":"3c82eeae-933f-4883-9942-1fc82ff293de","resolution":{"observed_at":"2026-05-15T04:27:43.084022Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.02719","last_updated":"2021-06-04T21:03:52Z","snapshot_observed_at":"2026-08-01T16:31:31.593344Z","submitted_at":"2021-06-04T21:03:52Z","title":"Hierarchical Video Generation for Complex Data","version":1},"cited_work":{"arxiv_id":"2106.02719","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.02719","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hier- archical video generation for complex data","venue":null,"work_id":"70163995-e878-4b3a-a64e-14bf55c851be","year":2021},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2106.02719","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:9c303466bc04fc1df6230b4b0df45a4d696518c7a2bed880de3e78c11653c013","observation_id":"f53cda0d-ad83-49e1-8834-1e695217d998","resolution":{"observed_at":"2026-05-15T04:27:43.114294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"9f6d98a1-8a67-4c73-9285-5883f9f33a56","year":2021},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:f80313d2ca4592d41fe189f1b85cd0c2f6c4ec815accde5086f4419384878785","observation_id":"918bf336-a83e-418b-85c0-2a5dfa76df44","resolution":{"observed_at":"2026-05-15T04:27:43.382084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"79ce61b1-69be-4667-80fd-eb5b40b6dcb4","year":2021},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:2d2ac7d29331b715269af4f4afef35139efc49bd1902185a2ae5769b09d5ca55","observation_id":"d73d06ab-a828-47bf-8727-98057860a559","resolution":{"observed_at":"2026-05-15T04:27:43.388548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03638","last_updated":"2022-09-24T20:49:24Z","snapshot_observed_at":"2026-07-06T12:57:58.716731Z","submitted_at":"2022-04-07T17:59:02Z","title":"Long Video Generation with Time-Agnostic VQGAN and Time-Sensitive Transformer","version":4},"cited_work":{"arxiv_id":"2204.03638","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.03638","snapshot_observed_at":"2026-07-03T05:27:40.599122Z","title":"2022 , journal =","venue":null,"work_id":"83e7f977-dcd8-45f3-9605-f4fd41758d04","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2204.03638","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:f18f77d062549a8e0e7f628bb21a443a2c4e0e68659b715ca0fd359d240d9284","observation_id":"bf101d3b-eb4d-475f-845f-be1e5a5b6298","resolution":{"observed_at":"2026-05-15T04:27:43.184025Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Probabilistic video generation using holis- tic attribute control","venue":null,"work_id":"cfd72bd6-75fb-4a9f-911a-355c37db1403","year":2018},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:4c04838a5a0a1b6db1c92c3a022419f351b6da02d00d5c05ff67f3bb789f6cf6","observation_id":"733b05bc-3ead-4c78-ad3a-6656d393d6dd","resolution":{"observed_at":"2026-05-15T04:27:43.394273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:98cc139dc284ac51b82ff7cfbdacad236330e39e3baa859dd677d49ed4e74058","observation_id":"d6f60504-ade3-4e78-82fc-933fc3f97718","resolution":{"observed_at":"2026-05-15T04:27:43.092153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"77182fda-928a-464c-a7e1-31ccc3fa3831","year":2020},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:cd93f5aaf74d6cf3d9f646e339912912388a1a02f20533174a76cad7e56eec58","observation_id":"c4b402cb-056b-49e8-9c5c-0407e6fde9a3","resolution":{"observed_at":"2026-05-15T04:27:43.400698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cascaded diffusion models for high ﬁdelity image generation","venue":null,"work_id":"a9e063fd-7ae5-482e-a52f-8229325d84c1","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:6c2f28407c948e59915e49723366d3f76f42944d8d1f436ab5352250f10e4d59","observation_id":"665fc95f-8d1f-4c0a-a6e0-76ca5ec854eb","resolution":{"observed_at":"2026-05-15T04:27:43.408132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:743b16573e7445aeae84602f63f3ecc8c8b2b467970055021ef598a8260a3a08","observation_id":"15c533e9-2cdb-4b9e-becc-b4b62cf41892","resolution":{"observed_at":"2026-05-15T04:27:43.341167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2204.03458","doi":"10.48550/arxiv.2204.03458","metadata_source":"pith","pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Video Diffusion Models","venue":"cs.CV","work_id":"02e03469-549e-4b5a-9bf0-ac6617a89882","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:65640b054132fdf0971e8ec3fe4ef03b11f25a82a13ff5f488ace64f652d1de7","observation_id":"8dbc538d-3d40-42fb-a4b9-4b7c498e83be","resolution":{"observed_at":"2026-05-15T04:27:43.347557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:3d269eec6a03b6f097742fe0789de9a0111f79e5a00171455b0c3266ea386348","observation_id":"de390fe3-c966-4a37-8b80-fbb52d5b6fd3","resolution":{"observed_at":"2026-05-15T04:27:43.073618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alias-free generative adversarial networks","venue":null,"work_id":"3c9f232f-9b25-416d-bbf0-999cfa97c474","year":2021},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:3c020278b99de0e8910ee3b52b19e9f3ad965dc37b8c5708df5482f3dc62653b","observation_id":"c83a58cd-f2ee-40d3-b958-1b6f591141c6","resolution":{"observed_at":"2026-05-15T04:27:43.413291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"e20a13e4-26c4-40eb-ad55-3ae733c9f9a3","year":2019},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:cf11a9e129d7c32a163e69f7b57010ee4eb1cd9d87c0db31c93ffc677835676e","observation_id":"5da374dc-d475-4b60-88c8-9f790e6d8b49","resolution":{"observed_at":"2026-05-15T04:27:43.419062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analyzing and improving the image quality of StyleGAN","venue":null,"work_id":"98315c69-f0c8-47bf-9810-5e25f264f1ee","year":2020},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:b062af4a5b57456628c34498e704f4e1d368e0c272c7d4bda949fccf5447934e","observation_id":"c9cde322-dcfb-4b19-a9f8-1b676a0d5b55","resolution":{"observed_at":"2026-05-15T04:27:43.425138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.01434","last_updated":"2020-02-12T16:55:25Z","snapshot_observed_at":"2026-07-06T07:36:59.181170Z","submitted_at":"2019-03-04T18:55:45Z","title":"VideoFlow: A Conditional Flow-Based Model for Stochastic Video Generation","version":3},"cited_work":{"arxiv_id":"1903.01434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1903.01434","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kumar, M","venue":null,"work_id":"e38118d4-c73b-48cc-8283-cae94f68ea0a","year":1903},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/1903.01434","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:aa3d4bf28f8f492316b8212f5ac2834541cda3b9c18a2ff3ac7fa7135f4bbab6","observation_id":"cda39ffe-678d-41b0-8582-07cda9da8479","resolution":{"observed_at":"2026-05-15T04:27:43.124785Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-02T18:14:47.498475Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":"2112.10741","doi":"10.48550/arxiv.2112.10741","metadata_source":"pith","pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","venue":"cs.CV","work_id":"34430d19-7919-48ce-88a5-17b3bfe2192e","year":2021},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:53b5eb40c356c95221169dc27c05ef219f713afee14e86a9bd59d590bbaf67df","observation_id":"b4399b38-8847-4ac3-8fcd-92543804144c","resolution":{"observed_at":"2026-05-15T04:27:43.171099Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":"2991ae40-45a2-42f0-a671-f67dff7b9d8a","year":null},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:f349ae26dee47a4a4d679c55dc567159b25b109153b457ef72b2cd18f1636b15","observation_id":"1e47dc78-b73a-4eea-9e32-1e5e8f30c595","resolution":{"observed_at":"2026-05-15T04:27:43.430399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00937","last_updated":"2018-05-30T14:58:27Z","snapshot_observed_at":"2026-08-01T14:58:21.912263Z","submitted_at":"2017-11-02T21:14:44Z","title":"Neural Discrete Representation Learning","version":2},"cited_work":{"arxiv_id":"1711.00937","doi":"10.48550/arxiv.1711.00937","metadata_source":"pith","pith_arxiv_id":"1711.00937","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Neural Discrete Representation Learning","venue":"cs.LG","work_id":"0148b1f3-8d2b-42bf-a801-174dc56f7597","year":2017},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/1711.00937","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:3ca24e7415108ad63ea8331b446b8ff53a6dee2136d548a3ba6165ee254c6df3","observation_id":"d344bff4-be90-4710-b3fb-e5ed0c5b563d","resolution":{"observed_at":"2026-05-15T04:27:43.226661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10704","last_updated":"2020-06-18T17:38:38Z","snapshot_observed_at":"2026-07-06T09:30:29.131472Z","submitted_at":"2020-06-18T17:38:38Z","title":"Latent Video Transformer","version":1},"cited_work":{"arxiv_id":"2006.10704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.10704","snapshot_observed_at":"2026-07-03T00:47:29.712597Z","title":"Latent video transformer","venue":null,"work_id":"203e8a6d-4ac5-43c6-a221-7fe2845a6a97","year":2006},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2006.10704","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:d61c36c8832c0f459523b25e7587fc2d4a471597192defa3dfad6ff125798da0","observation_id":"b4dae0c9-2195-43ad-89ba-97b76718f8a3","resolution":{"observed_at":"2026-05-15T04:27:43.284865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-07-10T15:47:23.275572Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:ad331b4cf76abf2be4ee4c2d0f383787e1b0db2de13e0440ddf19a309051f074","observation_id":"5508273f-ce86-4e0f-9572-61503dada6ee","resolution":{"observed_at":"2026-05-15T04:27:43.307642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"e590bb76-2fb3-412d-9828-8f94ae33025f","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:7af399a230680e12d4a5c02e5c4e6132244892d59cff7a4600c57266f33b52ef","observation_id":"da883871-fd7e-4406-b4ee-6b844c62d42e","resolution":{"observed_at":"2026-05-15T04:27:43.437657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":"d4f53bc5-49e6-4777-afab-dfc3a99ef172","year":2015},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:2ca824df548ab37dc5ac00c7639b1c6c7843d9025c71a16bfa588c755212e86a","observation_id":"579e7168-8aac-4f35-a65f-8ef404a39619","resolution":{"observed_at":"2026-05-15T04:27:43.443523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":"2205.11487","doi":"10.48550/arxiv.2205.11487","metadata_source":"pith","pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","venue":"cs.CV","work_id":"af16442b-a46f-469d-8818-c37b53a504c7","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:cafd95ac87493233ec07b0dd87d535349896e600ad71faaa210945bf686f56c1","observation_id":"556bdf18-43a0-4401-adc9-0950ea53b84c","resolution":{"observed_at":"2026-05-15T04:27:43.064904Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tempo- ral generative adversarial nets with singular value clipping","venue":null,"work_id":"8f4b5664-7f74-4a83-b16e-17dab38f82f3","year":2017},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:425d1c1d33aa524aba164d58bb795dff3d879cb5ea9293dfb24b5af2dba47b35","observation_id":"c7b03952-186d-4ee7-8a0f-6e5467f94003","resolution":{"observed_at":"2026-05-15T04:27:43.448655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Train sparsely, generate densely: Memory- efﬁcient unsupervised training of high-resolution temporal gan","venue":null,"work_id":"f02e3873-6fc7-47ab-9d0b-3723cc61f89b","year":2020},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:2e3b1b60c93cda5ab84fab4389f6024809b99082b460c5cba05a75848855ac02","observation_id":"effa888e-c891-4a46-a1d2-a8803f74f83d","resolution":{"observed_at":"2026-05-15T04:27:43.454185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"First order motion model for image animation","venue":null,"work_id":"d04b735e-2fd5-4084-a2bc-8b15bdfe1a14","year":2019},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:5ce3c77b65eac53c1ad336e73a2ba9e03805a6aa591a3cc28bb0eabbcbcfae8e","observation_id":"9c79e3e2-7078-46fa-b69e-6e162d87dee9","resolution":{"observed_at":"2026-05-15T04:27:43.459306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":"2209.14792","doi":"10.48550/arxiv.2209.14792","metadata_source":"pith","pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","venue":"cs.CV","work_id":"52a801fc-a707-45a1-a8cd-0d6702f124ab","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:1ff009c0c36564f0df0c329466f452a348827b873feb35ee8724e763f7beabc1","observation_id":"9ec4fb35-2e0b-405b-9920-de97808b3d76","resolution":{"observed_at":"2026-05-15T04:27:43.103180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"2263303b-c618-4aa4-a379-42e2b492b41b","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:cd34da28012efc5aa7e8731306febac40b9e3445955c10d29d3230f316db6ca0","observation_id":"c6ba3996-ac60-4f49-a9ad-32636a29e630","resolution":{"observed_at":"2026-05-15T04:27:43.465746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"0e33b02b-91d3-4e7c-bb6c-9473055fa7f7","year":2015},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:bb7d84b42d4896a45f9e82cca1526f17f7a829fe019da9358f2eb69d0ac25c79","observation_id":"38ca72f1-1271-49c9-ac91-a6b97ced4836","resolution":{"observed_at":"2026-05-15T04:27:43.374890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-07-11T02:47:49.167563Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:c2d22e33415cd656aa9933b508e432de76c01c88f586a3975094926419ea323c","observation_id":"0af98eea-82e8-4d4a-9d32-416e9a36492b","resolution":{"observed_at":"2026-05-15T04:27:43.133774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:b9db7257a917e16fd7b76a79dc5a48982ffd3517cced60f6947455e37e6d478b","observation_id":"c445a267-bbe3-4e5a-a9ae-bfbd3b7ee55c","resolution":{"observed_at":"2026-05-15T04:27:43.145334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":"1212.0402","doi":"10.48550/arxiv.1212.0402","metadata_source":"pith","pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-07-11T03:07:53.363433Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","venue":"cs.CV","work_id":"5dfb46e7-e952-409d-a3c7-ba7f20aebad6","year":2012},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:11a42f563a8dc0785d8260cdc2fbe5abb4d4700ffc5ccb470df3d129cb23bbf5","observation_id":"9e10fe63-8816-4603-a928-48fb9ae5968c","resolution":{"observed_at":"2026-05-15T04:27:43.158785Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metaxas, and Sergey Tulyakov","venue":null,"work_id":"d9a151a1-469b-494d-9445-fefaadc4ad70","year":2021},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:882e108a1e6ce6cf075d5151c3cf3e78c9bcf9260d1a28590214d2ddb483b23d","observation_id":"6f0334b5-66f4-4850-ab71-ed691590d643","resolution":{"observed_at":"2026-05-15T04:27:43.477205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mocogan: Decomposing motion and content for video generation","venue":null,"work_id":"f114a298-c694-4652-a02e-103af2acbb1d","year":null},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:8393ff599f922a8b72cefed4909587646208100168f2dc24ae0ba4ec453e01cb","observation_id":"88211934-84d3-44c3-984e-b7153c37284d","resolution":{"observed_at":"2026-05-15T04:27:43.486396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":"1812.01717","doi":"10.48550/arxiv.1812.01717","metadata_source":"pith","pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","venue":"cs.CV","work_id":"72f42543-17d5-49aa-ba5a-25d67ffbb88a","year":2018},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:c0db7caccbae9e5b6745e984eaae0a04d9be8a5ed13214c44d3c1b811659c60b","observation_id":"6e65da46-c00d-4bd0-9973-2d56a9c425f4","resolution":{"observed_at":"2026-05-15T04:27:43.211816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":"e631001c-0593-406e-8715-4d56ab149662","year":2019},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:0b1f6a505a782638ec63235bd536441b6df0c583d5c0a4965afc0dba44a5fa5a","observation_id":"4bf1dd9b-1663-444a-9ace-bb8178b5deb0","resolution":{"observed_at":"2026-05-15T04:27:43.494584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09853","last_updated":"2022-10-12T19:33:40Z","snapshot_observed_at":"2026-07-06T13:11:50.069827Z","submitted_at":"2022-05-19T20:58:05Z","title":"MCVD: Masked Conditional Video Diffusion for Prediction, Generation, and Interpolation","version":4},"cited_work":{"arxiv_id":"2205.09853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.09853","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked conditional video diffusion for prediction, generation, and interpolation.arXiv preprint arXiv:2205.09853","venue":null,"work_id":"e18c4e33-d18e-4737-916c-253a576f063e","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2205.09853","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:722db288cb6b377d958091f688509d15f9110a6dda5b8db9b67acce49084c10b","observation_id":"09a0afcf-cb2b-4d68-8906-433f5da396eb","resolution":{"observed_at":"2026-05-15T04:27:43.254780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating videos with scene dynamics","venue":null,"work_id":"2e3b3c07-dfc3-40c5-aa30-b3cf63842f86","year":2016},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:a14d0e5a9aef2c5c0f06c7dff41d614b1fca39eb74234fdcc9f456d8afa5fc96","observation_id":"07076b5a-8092-45dd-930e-492eccf7eae9","resolution":{"observed_at":"2026-05-15T04:27:43.500471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01950","last_updated":"2021-03-02T18:59:10Z","snapshot_observed_at":"2026-07-06T10:46:11.856932Z","submitted_at":"2021-03-02T18:59:10Z","title":"Predicting Video with VQVAE","version":1},"cited_work":{"arxiv_id":"2103.01950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.01950","snapshot_observed_at":"2026-07-03T00:47:29.725111Z","title":"Predicting video with vqvae","venue":null,"work_id":"e5802151-2b34-4985-80d8-c5d24e27ca8e","year":2021},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2103.01950","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:bc4e56818745397a989946e8db02440fe8d430c70bd80c6ae60fa496bdac501c","observation_id":"0883370d-3f6a-41f7-af22-279bbe3ceed3","resolution":{"observed_at":"2026-05-15T04:27:43.291686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02634","last_updated":"2020-02-10T19:29:56Z","snapshot_observed_at":"2026-07-06T07:58:30.747165Z","submitted_at":"2019-06-06T15:06:21Z","title":"Scaling Autoregressive Video Models","version":3},"cited_work":{"arxiv_id":"1906.02634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1906.02634","snapshot_observed_at":"2026-07-03T00:47:29.660618Z","title":"Scal- ing autoregressive video models.arXiv preprint arXiv:1906.02634","venue":null,"work_id":"f1a25110-82fe-413c-866c-927d93520b88","year":1906},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/1906.02634","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:cb136388ddc263a634f22ad3fb537535dfd63373dd861b646c111b9321456312","observation_id":"f9c02821-88b2-4b9f-b6d3-eb53bee47fb9","resolution":{"observed_at":"2026-05-15T04:27:43.301157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to generate time-lapse videos using multi-stage dy- namic generative adversarial networks","venue":null,"work_id":"9853310d-b030-4763-b995-523695019b40","year":2018},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:799175f79087451c82d8198e394ac79495485697b206ee4e835d27fc1a3e11bf","observation_id":"4261e0cd-b733-4a67-b42d-c899cd6c7c34","resolution":{"observed_at":"2026-05-15T04:27:43.507423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":"2104.10157","doi":"10.48550/arxiv.2104.10157","metadata_source":"pith","pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","venue":"cs.CV","work_id":"703c74c3-fa5e-455c-8c00-697c83511fcf","year":2021},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:1b22b84ba179693bbeee85ca8b9b3a75c8c1f8546a5277ac6895082fc3473554","observation_id":"76e4ecc2-d983-4a2e-8f5c-d5b39a956b57","resolution":{"observed_at":"2026-05-15T04:27:43.315077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07685","last_updated":"2023-03-30T07:08:21Z","snapshot_observed_at":"2026-07-06T14:52:07.793181Z","submitted_at":"2023-02-15T14:22:34Z","title":"Video Probabilistic Diffusion Models in Projected Latent Space","version":2},"cited_work":{"arxiv_id":"2302.07685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.07685","snapshot_observed_at":"2026-06-29T16:23:39.198869Z","title":"Video probabilistic diffusion models in projected latent space","venue":null,"work_id":"39ea6868-b178-4cc3-a6e7-d17d62ca22a8","year":2023},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2302.07685","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:be4e0cf7fdc2a777196448d115a6a9efe855c4b14cec7a89635670cf3660bae2","observation_id":"f4f688cf-9e60-4d1b-a417-1b1f7d14591d","resolution":{"observed_at":"2026-05-15T04:27:43.331944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating videos with dynamics-aware implicit generative adversarial net- works","venue":null,"work_id":"1e78059e-2524-4aba-a7e7-a6cf222452cf","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:ea8631fbb45e0e3aca2ed48f4e0652cc824fbf2d0754f8f98da7029ac6541e24","observation_id":"b9bd0129-80e7-4c0d-b047-a3f17e363018","resolution":{"observed_at":"2026-05-15T04:27:43.514043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"8a8a96fa-06a8-41bb-a47c-beffc32ba577","year":2018},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:4eadc8d5bbccd72b43c19a8f448b2330b58441ccfac7b28104a5db6f76afba47","observation_id":"b3807d25-9050-4867-aad1-5a72bfcee42e","resolution":{"observed_at":"2026-05-15T04:27:43.522024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2211.11018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-07-11T01:57:50.042360Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","venue":"cs.CV","work_id":"aad71b40-2721-438d-8e8c-97f84063ed39","year":2022},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:f5a0e6610187d4de913bdd2150c0d7b6a45a74c7a272a58f1ce7138c4d81fd86","observation_id":"12f5d082-5cb5-4c9d-ab03-122d6fe88902","resolution":{"observed_at":"2026-05-15T18:47:57.649874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":21,"verified_fuzzy":24},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 62 inbound Pith citation observations for arXiv:2211.13221."}