{"as_of":"2026-08-18T09:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ed63badba9f340cce5b4cbf14c8556f070b29ff7e1a99ab598d9d2edca68088","coverage":[{"denominator":187,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:37:14.801702Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T10:56:16.054496Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T10:58:13.835764Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"cited_work":{"arxiv_id":"2412.18688","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18688","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Shahzad, M","venue":null,"work_id":"c3e5d635-06e2-4910-a96e-f4947d19f105","year":null},"citing_paper":{"arxiv_id":"2605.18233","last_updated":"2026-05-18T11:28:45Z","snapshot_observed_at":"2026-08-16T14:49:25.665753Z","submitted_at":"2026-05-18T11:28:45Z","title":"Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T10:56:16.054496Z"},"links":{"cited_paper":"/paper/2412.18688","citing_paper":"/paper/2605.18233"},"observation_digest":"sha256:9b924751b3571ac5a90192ad58900983ff1b7431e7a41ac8e19862346b9c11f8","observation_id":"ed620966-a4cf-4a2b-a333-065cb5f1806b","resolution":{"observed_at":"2026-05-20T10:58:13.837416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.18688/citation-record","integrity":"/paper/2412.18688/integrity","json":"/paper/2412.18688/citation-record.json","paper":"/paper/2412.18688"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.383491Z","title":"Video generation models as world simulators by open a.i, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.383491Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:fabe869ed9ccbed4f26861e4ceb7dabae6e6aca96ccc9fc43921c28ce1c59461","observation_id":"3f5c52f7-f554-4423-98b2-4ccc57f1ccd9","resolution":{"observed_at":"2026-08-11T04:37:14.383491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.387900Z","title":"Introducing chatgpt by open a.i, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.387900Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:71fdd8d0ab8b8d2377ef551ed156dd484b11bd9d368279fd65b6caf46805b6e5","observation_id":"1d6830a5-4ef6-4a7a-8123-2b99072bcdf8","resolution":{"observed_at":"2026-08-11T04:37:14.387900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.391439Z","title":"Meta llama models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.391439Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:2a20918aad5393c8a79926e2686574653eadf4321fdc73c5180341d94df4742d","observation_id":"73e61bf6-ecc7-4a84-b4f1-7cd2999a00ad","resolution":{"observed_at":"2026-08-11T04:37:14.391439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.395190Z","title":"Google gemini series, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.395190Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:1a8a6607532d55b2957b69da32324abceeef5b0bf11e4673585129998fd4e39c","observation_id":"6dba3691-0a87-47da-8617-83bc04eecbe7","resolution":{"observed_at":"2026-08-11T04:37:14.395190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.400143Z","title":"Anthropic by claude, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.400143Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:b8a4890071c47bc7d20da1445a39b8c77c147684ac740f4b49750cb060b8da19","observation_id":"a2576c1b-ec00-41d2-9df2-f3a8f6501a1f","resolution":{"observed_at":"2026-08-11T04:37:14.400143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.404176Z","title":"Mistral large model by mistral, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.404176Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:75ff1a5b867a53c4959d5b8bc97cb56f542aaa3338720ad7435b1c8093642cc5","observation_id":"49f9dc04-d8d1-4b41-b5d7-42ff15665d72","resolution":{"observed_at":"2026-08-11T04:37:14.404176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.408021Z","title":"Hierarchical text-conditional image generation with clip latents, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.408021Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:1eaa77b8b27b59217f52281101e8c7571a1cd8d206374bc38cf7ccddd6fda725","observation_id":"f6b7943f-0f31-4d0e-9c8c-90ed161f509e","resolution":{"observed_at":"2026-08-11T04:37:14.408021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.411624Z","title":"Scaling rectified flow transformers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.411624Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:c2a70510d64861d2072cc3766b735b6c4515a9a0e400052d93f6ed8f257beddf","observation_id":"a5b2b837-f056-439f-ac48-4f0c739eafb5","resolution":{"observed_at":"2026-08-11T04:37:14.411624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.416060Z","title":"The midjourney v5.2 model for image generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.416060Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:cbc0128119552c66bbf07259766751f0d2e392839db88cdf6702abedd69dad34","observation_id":"44c30872-f7a0-42fc-a98a-ffa15714742b","resolution":{"observed_at":"2026-08-11T04:37:14.416060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.423947Z","title":"VideodirectorGPT: Consistent multi-scene video generation via LLM-guided planning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.423947Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:c4db9ac2ecb109fa0c5e1aa0239162b6e96a3e4cd6dce526b1cc0a6d6fc25d9b","observation_id":"6db003ce-e59e-4e92-9358-1448c9b2bf96","resolution":{"observed_at":"2026-08-11T04:37:14.423947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.428291Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.428291Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:07d2ef3fd24776da48ebf0e424aaeec6d0be08a0e9a22ff35e9524ef5744cd77","observation_id":"eb451ad4-0f24-47cb-a8c4-f194b88e4719","resolution":{"observed_at":"2026-08-11T04:37:14.428291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.432170Z","title":"Gen2 by runway ml, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.432170Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:d678530eb9b8842e113df9a7e3053c9b9930f64cb21f08e06218f8761c486e4b","observation_id":"caefaae3-3e22-46ba-998c-01e17f0cf005","resolution":{"observed_at":"2026-08-11T04:37:14.432170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.435916Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.435916Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:90031bdb2ed2d38167168f05db2da781451def71c8223ff2df8497629f6b0bda","observation_id":"548c3fb9-bd96-4d36-b82b-7ae71c8772a5","resolution":{"observed_at":"2026-08-11T04:37:14.435916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.443960Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.443960Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:ce3bdb3a50c9ece8803eda0c4052ded48b0a9b8055b89279287c9e0fabb1344c","observation_id":"87325dd2-a846-47d6-9444-4dc5139caccc","resolution":{"observed_at":"2026-08-11T04:37:14.443960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.447977Z","title":"Gen-4 alpha by midjourney, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.447977Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:44bbbe29395072f62b1cb5afa6ba308bb0bb79ed6b6907b1e7417a1469d636af","observation_id":"019d4e69-d36e-4506-88b0-161f410528ed","resolution":{"observed_at":"2026-08-11T04:37:14.447977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.451981Z","title":"A survey on long video generation: Challenges, methods, and prospects, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.451981Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:2dc6d480b4439479201e4756df65defc7b88b5391c1d4e41f9cf9e6e85a4e37d","observation_id":"27302c44-f4a3-4abf-8d6b-d0e0c7b08586","resolution":{"observed_at":"2026-08-11T04:37:14.451981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.455327Z","title":"A survey on generative ai and llm for video generation, understanding, and streaming, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.455327Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:67283563391658fa699d18b26f028d4ec7ba95647167835ce5a6b9ae2c6ff6ec","observation_id":"7a0018e5-fb00-4a80-85a6-0e33bf002ca1","resolution":{"observed_at":"2026-08-11T04:37:14.455327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.458733Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.458733Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:098f678cda77d4fcc3b0ca09b4cf6244db502f24e04c8bc49471272bc8f27332","observation_id":"8cad888a-61a3-4a28-ab96-7b46cbe14209","resolution":{"observed_at":"2026-08-11T04:37:14.458733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.462880Z","title":"Free-bloom: Zero-shot text-to-video generator with LLM director and LDM animator","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.462880Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:347a7906c52d91fa392a549c22e89f41e5b0894fe1a7053aae7f4aab9ac51730","observation_id":"8ce84fef-7f8d-445f-85ab-717bc83509e8","resolution":{"observed_at":"2026-08-11T04:37:14.462880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.466710Z","title":"Flowzero: Zero-shot text-to-video synthesis with llm-driven dynamic scene syntax, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.466710Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:e5802d8ba6e12efc9b05dd4c63f95e79f17f441ea51219aea100504e5980bead","observation_id":"b33cc5f5-e159-4f70-b46d-6983ea86a88e","resolution":{"observed_at":"2026-08-11T04:37:14.466710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.469740Z","title":"Align your latents: High- resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.469740Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:c9611fb396a02a564ab256c11782e533b7b5d133bb487347916b4730ff1185b8","observation_id":"53516192-30a6-49d7-adbd-aa0feaa1087a","resolution":{"observed_at":"2026-08-11T04:37:14.469740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.473186Z","title":"Mavin: Multi-action video generation with diffusion models via transition video infilling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.473186Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:da62946493835d3e4082dc462444324bb66a0b5f2beb0832c7c5fff0c3c251ff","observation_id":"1db71ba0-b625-424c-a9fd-83f4767161af","resolution":{"observed_at":"2026-08-11T04:37:14.473186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.476649Z","title":"SEINE: Short-to-long video diffusion model for generative transition and prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.476649Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:4a15a858f1e185326617259281eca55634eab1b0c75cc83aef5ea823983e08b5","observation_id":"29eaa73f-033d-47ea-9e4c-183dffd434db","resolution":{"observed_at":"2026-08-11T04:37:14.476649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.480144Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.480144Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:397ca89c6e08a4f7bb36b5ef0d14296ad91ff7f4a88b53683b08b21858e870d5","observation_id":"e7d90b62-6189-4c5e-ba2c-30b251999f9e","resolution":{"observed_at":"2026-08-11T04:37:14.480144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.483541Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.483541Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:7d86a3ed959e6569ff3c0c5382a076d9c3188b64beea02bbfa3e25b6b014cb5e","observation_id":"a3e3613a-024c-450f-bee0-a403509c066d","resolution":{"observed_at":"2026-08-11T04:37:14.483541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.488168Z","title":"Unsupervised representation learning with deep convolutional generative adversarial networks, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.488168Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:1f478746929bd67dde74affa9436b06c51d5b615a7de6bd7227004bd7c34703f","observation_id":"25f2d8a0-6316-4d33-a13c-9e33b9c973fc","resolution":{"observed_at":"2026-08-11T04:37:14.488168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.492876Z","title":"Deep generative image models using a laplacian pyramid of adversarial networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.492876Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:1f69e6e42936aecd34be8fb36ec854a1ef84115a66df859fe90754a5d2714dce","observation_id":"a6101203-873c-4616-a164-fea0b5d4ccbe","resolution":{"observed_at":"2026-08-11T04:37:14.492876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.496953Z","title":"Stackgan: Text to photo-realistic image synthesis with stacked generative adversarial networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.496953Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:ba3921b27fba41194744b17c99d8e6d8e037c4991903c8fa9bd6b37cc99368c2","observation_id":"6bcb1f2f-56be-45d9-b22c-2b7ff2309283","resolution":{"observed_at":"2026-08-11T04:37:14.496953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.501400Z","title":"Attngan: Fine-grained text to image generation with attentional generative adversarial networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.501400Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:f52436eeb8567a8bc9390f84970a1797037b1e5d20ab4db0faa93af8f46f7ff1","observation_id":"3b43eca4-4348-4faa-998a-04ab263bc7bc","resolution":{"observed_at":"2026-08-11T04:37:14.501400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.506500Z","title":"Analyzing and Improving the Image Quality of StyleGAN","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.506500Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:478d3e41a9b0bd321fc5aff630377300395a29cd0a10dac8d621e0c402b824a1","observation_id":"471641e0-f60c-46e4-be61-2485a4e9bad9","resolution":{"observed_at":"2026-08-11T04:37:14.506500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.510690Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.510690Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:6e6f8278db2b7ad87f5110a1b2f0a1549d2f299c6a12ed5421b123be22e25cd7","observation_id":"747ac8e1-caa9-45ce-96ee-418a2f1364df","resolution":{"observed_at":"2026-08-11T04:37:14.510690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.515413Z","title":"Stylegan2 distillation for feed-forward image manipulation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.515413Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:6a8696db951ce5a0aa2e5d95b7d22ee35e505eabf16acadc6fe06f2abd6d880b","observation_id":"a8ccc019-4d0c-4d9a-ba45-8ae6980ec084","resolution":{"observed_at":"2026-08-11T04:37:14.515413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.520232Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.520232Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:a9e016539610bb70255112eb1a13e1b507845743284b1c74bfa227cd08ee72a1","observation_id":"f964f7cf-5ee7-417d-a84f-417245c0816f","resolution":{"observed_at":"2026-08-11T04:37:14.520232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.523881Z","title":"Deep multi-scale video prediction beyond mean square error, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.523881Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:d34152c64cb56210778179a8b30e11ddc35df0367858d65639211098c0cbb260","observation_id":"a5deffb8-65f6-4ee0-b9af-fe946c7c2278","resolution":{"observed_at":"2026-08-11T04:37:14.523881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.527985Z","title":"Generating videos with scene dynamics, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.527985Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:9a96251d6b08d492f7b8a26b22898778a96310f2e2bbc30ad23230bc8bbd8756","observation_id":"cb3c7ede-6527-44d8-90ee-7ea998f07ca6","resolution":{"observed_at":"2026-08-11T04:37:14.527985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.531670Z","title":"Learning to generate time-lapse videos using multi-stage dynamic generative adversarial networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.531670Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:9bfd66aca0964d0f464bc7211ba2c550f034c71be54aef209eb86a81da8f2943","observation_id":"585fb8f7-0c81-43d4-a131-f0bcbccb5de0","resolution":{"observed_at":"2026-08-11T04:37:14.531670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.534876Z","title":"To create what you tell: Generating videos from captions, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.534876Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:cc9d1bd31466540bc5ffff442ed66af7a904e3817d92885e27cd33e7c971a047","observation_id":"9956f5ac-8c22-4648-bafe-41cebffc43d5","resolution":{"observed_at":"2026-08-11T04:37:14.534876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.538591Z","title":"Generating videos with dynamics-aware implicit generative adversarial networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.538591Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:077154821b0a015b3849f9721df238ff64a16920418f02622b4364be1ad77463","observation_id":"771ed588-f2af-443e-b25b-ce4f98d2c5b6","resolution":{"observed_at":"2026-08-11T04:37:14.538591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.542963Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.542963Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:19f4fbd01dc649c1d2abebc7a17f5a1075c7164302ffad0546077384854f2603","observation_id":"3a56a940-90e5-4593-b4f3-ba8c55d5907d","resolution":{"observed_at":"2026-08-11T04:37:14.542963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.547400Z","title":"Auto-encoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.547400Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:33ee75c727cd94f66ef7f0c9ec0fae88faa4e99aa3576b3441a7d14298151587","observation_id":"8164accd-5bcc-43e5-9479-a94d0cddb4b3","resolution":{"observed_at":"2026-08-11T04:37:14.547400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.551351Z","title":"Auto-encoding variational bayes, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.551351Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:09a72ba51240a9319d4f2d1a61e761dde9024e6d3dd1bb328115c2d5bdd9be87","observation_id":"50890519-6ac8-48af-b85e-3762cfbd14b1","resolution":{"observed_at":"2026-08-11T04:37:14.551351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.555242Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.555242Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:749df84952dcb9b474cdd1b1dc50175e4bcb091a58231f41a50839e1010eec41","observation_id":"5f70f62d-b848-41af-bbdb-adcf31b3f3c1","resolution":{"observed_at":"2026-08-11T04:37:14.555242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.558857Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.558857Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:2f095e5850508a0ad3163ef422cb52eeb427ba4e4347feb413efa5a36d0fbac7","observation_id":"61f3e908-ac56-4dc1-8a69-f718088e875d","resolution":{"observed_at":"2026-08-11T04:37:14.558857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.562789Z","title":"Neural discrete representation learning, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.562789Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:a7e37b6999b2705620ffca94e5eb159383b22590d279780715190775d55a1064","observation_id":"1a2a6069-d35a-4b7f-88a0-124b30532e7a","resolution":{"observed_at":"2026-08-11T04:37:14.562789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.567054Z","title":"Videogpt: Video generation using vq-vae and transformers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.567054Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:5910fbad8489ac6102146adceac0a71c6870a04d5bc04e0cc089c0d9ba0e0538","observation_id":"b61f57a4-e37a-4dcf-9e92-2af188daac12","resolution":{"observed_at":"2026-08-11T04:37:14.567054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.571955Z","title":"Taming Transformers for High-Resolution Image Synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.571955Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:cd3875019d0e1b1cb9a6250e58ed13f98ca92df5e389b8df135f09ead48d68f2","observation_id":"a5ee5ed3-4b19-462f-b91c-372ee992677b","resolution":{"observed_at":"2026-08-11T04:37:14.571955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.575632Z","title":"Clip: Connecting vision and language with contrastive learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.575632Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:d7a67c8ad2eba4ffa984622c226abccc837929b4df52ca7b42f2dc0fd92ffd02","observation_id":"297c76c4-49f7-43c9-a868-b2a61026568c","resolution":{"observed_at":"2026-08-11T04:37:14.575632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.580081Z","title":"Hierarchical patch vae-gan: Generating diverse videos from a single sample, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.580081Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:022ea1378fb91dfdb80fe21fcfdbe00b114268102e161e699cc7df724081e7ab","observation_id":"7886cfb5-4676-4cf1-ba4a-debe256d3d34","resolution":{"observed_at":"2026-08-11T04:37:14.580081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.584402Z","title":"Visual anomaly detection in video by variational autoencoder, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.584402Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:5e77dc4487e6ccb1417e51b7f33b2f19edcd858323256750f97ce395c4ce9451","observation_id":"4ba1198f-ce4d-4e72-ab5c-387897c1f47f","resolution":{"observed_at":"2026-08-11T04:37:14.584402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.588528Z","title":"VideoMAC: Video Masked Autoencoders Meet ConvNets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.588528Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:f459435c32dc69e9b8b30eaefbd290337a4651d7d174274081b4f4a08fd2de74","observation_id":"58e45002-cae4-4d24-a161-718163aa8fcc","resolution":{"observed_at":"2026-08-11T04:37:14.588528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.592709Z","title":"Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.592709Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:cd3a088b600c8c7900b837399e8322606172c97477f3d4893412b9b62f45668d","observation_id":"d9e113b1-ea31-4de7-990f-c0216fbf308e","resolution":{"observed_at":"2026-08-11T04:37:14.592709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.596657Z","title":"MAGVLT: Masked Generative Vision-and-Language Transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.596657Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:31871ddba954a641f6b593816f7cf7dbb7de6a1758f9ed1fb69927d4706c35d0","observation_id":"e711213b-20c4-45f5-9782-039ff7bb9352","resolution":{"observed_at":"2026-08-11T04:37:14.596657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.601123Z","title":"Multi-generator generative adversarial nets, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.601123Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:bec8aed56c3778d2387904c3be6df0a2368c51ef1d874907d9e505424f77b1f9","observation_id":"f54feb84-e2f7-4198-a32d-a5ccf71850a6","resolution":{"observed_at":"2026-08-11T04:37:14.601123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.605272Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.605272Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:164a9dba9997448bdd16ed98558624536704a12663776e5374906c8e0b651034","observation_id":"672f3283-3b57-4842-b154-c837708ea08f","resolution":{"observed_at":"2026-08-11T04:37:14.605272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.609789Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.609789Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:2ba3c33903ce2b407317c27c66a7e4fd1f0def2df5fe6202480d0ff7458423fd","observation_id":"ab67dac8-77ec-41ef-8cba-0fd9cccc342f","resolution":{"observed_at":"2026-08-11T04:37:14.609789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.614593Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.614593Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:625a71768fed2c6575aaa866cd30209db2524587b6de2641fae9d877ac9fef20","observation_id":"674be2a5-a75d-4ef7-97e0-36899ebd4a5e","resolution":{"observed_at":"2026-08-11T04:37:14.614593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.618550Z","title":"Discrete variational autoencoders, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.618550Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:582d8151d2574d8d1fa3a3980ba3ccbc3c50322f7e37b39a617171706d08d634","observation_id":"24476f66-b907-4166-8f91-e195258a65c5","resolution":{"observed_at":"2026-08-11T04:37:14.618550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.622499Z","title":"Cogview: mastering text-to-image generation via transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.622499Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:41ec77202ff0bcc18eb08d306ac77a4cd904c136fe8f1180b45163592865f304","observation_id":"8f4e5b6e-8a70-4976-90e8-aebd69aac744","resolution":{"observed_at":"2026-08-11T04:37:14.622499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.627068Z","title":"Cogview2: faster and better text-to-image generation via hierarchical transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.627068Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:3ed6a3d9a7a30109dae014d396ea9872fe30f174f3ccccb954c85565d53f7575","observation_id":"0759d869-67bf-4a33-b9bb-78a8a21537b0","resolution":{"observed_at":"2026-08-11T04:37:14.627068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.630981Z","title":"ViViT: A Video Vision Transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.630981Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:046f1d89e57a69d62c1bcfdafa66a526c457a11f88c86f81a9f5e87677a20b10","observation_id":"1cd61a27-7f57-4bc3-9689-2c26826f016f","resolution":{"observed_at":"2026-08-11T04:37:14.630981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.634625Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.634625Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:d50e2399535ba5d654c1c620a4657549e90fa04e4df6b5e1a1a33e26b2fd11a5","observation_id":"bf455fbe-2f4b-43ad-bb6e-d674fed3e654","resolution":{"observed_at":"2026-08-11T04:37:14.634625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.639033Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.639033Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:518ecce8bf58a1abb290e4d5db7141f60e85afa8c717d6f3150b2b425766876c","observation_id":"98e6907e-fa47-424b-8263-76092dc5c8ce","resolution":{"observed_at":"2026-08-11T04:37:14.639033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.646492Z","title":"Compositional 3d-aware video generation with llm director","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.646492Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:22f97b9ca069b162fe79ab3c7bee0a5fa087cefc61f9aaba5795f93848afb5e8","observation_id":"d51c6616-a625-465e-a36b-9ee835221f0b","resolution":{"observed_at":"2026-08-11T04:37:14.646492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.651064Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.651064Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:7e61e311b4eed52044220c3e2f1e66e1cb3fc07462c622c650a8d376c21c9c3e","observation_id":"ce7d04d6-70c4-4cfe-b6b6-fba8dafb62be","resolution":{"observed_at":"2026-08-11T04:37:14.651064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.659432Z","title":"Vlogger: Make your dream a vlog","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.659432Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:12a0eef2b9bb623a5e5257b0bf44b9263a2f96708d557dcee7facf87f2e1027b","observation_id":"c0624193-859c-441a-9360-7b327783af10","resolution":{"observed_at":"2026-08-11T04:37:14.659432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.663326Z","title":"Weiss, Niru Maheswaranathan, and Surya Ganguli","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.663326Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:3476acf21e7ca44d1365c420ab5ec57bb4ed83b1a3b865a4e38d97c6b6277a53","observation_id":"28464bab-cacd-42a0-8b8e-6a36d6b8dfba","resolution":{"observed_at":"2026-08-11T04:37:14.663326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.667295Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.667295Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:5e50fbf80cb8e1ab5c2721c7709e327ccfa17d491df79f294689d21d6bccb2aa","observation_id":"809e94af-516a-42df-8fa9-9cda0b60434d","resolution":{"observed_at":"2026-08-11T04:37:14.667295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.671215Z","title":"Generative modeling by estimating gradients of the data distribution, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.671215Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:11a69541a253c42b9486379a05f06b31a8f48623a504df6232c6ef15df16c646","observation_id":"9c6abda2-81d8-4615-9f4a-5b466b82d892","resolution":{"observed_at":"2026-08-11T04:37:14.671215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.674802Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.674802Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:d7e1ffeb3e8f6ec255b0a83d9a7b27a6cac31f53c07ea98f5cf28fcf978fb3bb","observation_id":"c0612117-642a-4c76-892f-5cf5655b624e","resolution":{"observed_at":"2026-08-11T04:37:14.674802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.678399Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.678399Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:6c658c84ee858a6d03426b58c9650afa75e7bc6af29ec4e7a2501c89d20fdc59","observation_id":"980af4e7-9f53-4960-96ba-144781e41d43","resolution":{"observed_at":"2026-08-11T04:37:14.678399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.682202Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.682202Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:182ac4b888765a010268c2516085b886e9f01a549a113251fb786faa797768d0","observation_id":"26429073-5858-480c-b75f-2363e69b35e5","resolution":{"observed_at":"2026-08-11T04:37:14.682202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.685861Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.685861Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:a0125a0e45b666d533234ae90265283984c982a44cd6bb6d3daefc1826632743","observation_id":"d54f6a1c-577c-4c6b-9ab5-9036e18a0c1c","resolution":{"observed_at":"2026-08-11T04:37:14.685861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.689203Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.689203Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:b047f4ff3cff2a7d38137455ecc131a9b579fea756cfd7b67394933180dc5b32","observation_id":"228990ab-044b-4fa8-948d-bde650ce43ae","resolution":{"observed_at":"2026-08-11T04:37:14.689203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.692629Z","title":"Videotetris: Towards compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.692629Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:b375b552d47ee6f1ad18541cb337b4b0e142ef8606e8a8847f67319947a701b9","observation_id":"d1716863-5645-48f7-9882-90e13cd091ff","resolution":{"observed_at":"2026-08-11T04:37:14.692629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.696025Z","title":"Cogview2: Faster and better text-to-image generation via hierarchical transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.696025Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:aa48cc0244f6663d6bebefee4c292eb302e8ec5b8598a4b5601b11d781bcbee4","observation_id":"b4aa16af-7992-453a-8999-5dff9ab53953","resolution":{"observed_at":"2026-08-11T04:37:14.696025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.699925Z","title":"NUWA-infinity: Autoregressive over autoregressive generation for infinite visual synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.699925Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:6df5aade753fae3d3b28c7d7e91170506cff638703c6cb13a379e4c1461cae6d","observation_id":"a992bdac-de6e-4506-a688-280629395fdf","resolution":{"observed_at":"2026-08-11T04:37:14.699925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.703594Z","title":"Ross, Bryan Seybold, and Lu Jiang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.703594Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:57b4d79de0ec55a5446275e36e1936fbc7e0512cd5ff8f53708db3b4e113485a","observation_id":"e0b12db0-ee9f-4511-b94f-0b7e592b278c","resolution":{"observed_at":"2026-08-11T04:37:14.703594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.707116Z","title":"ART •V: Auto-Regressive Text-to-Video Generation with Diffusion Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.707116Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:34440be76c859df7f41a73b08ae853513bc14296a70f5c4c85917471f4f5b3a6","observation_id":"78620d1d-b30a-4889-8c72-12a49b0d737f","resolution":{"observed_at":"2026-08-11T04:37:14.707116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.711430Z","title":"Grid diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.711430Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:308c8983f1355cf1057c1db37ab388c5e12614ebe8dc9a08282055b54bfb2d9d","observation_id":"6571763f-b74d-4894-8b49-14ac584d540d","resolution":{"observed_at":"2026-08-11T04:37:14.711430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.720203Z","title":"Arlon: Boosting diffusion transformers with autoregressive models for long video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.720203Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:0f4a645680da6e915aa54f63a9c5e91134ce92a641e54cbd45180cc77fca02ea","observation_id":"b86fa8d6-a11d-4e74-9d81-a7bb7737db67","resolution":{"observed_at":"2026-08-11T04:37:14.720203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.724027Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.724027Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:45a00eee73ac9fec54f43964288d52a5b1c1b0c064cd634ed1308e4779bb4187","observation_id":"bd6c911e-4094-40f0-9bb3-02dfd32ce945","resolution":{"observed_at":"2026-08-11T04:37:14.724027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.728231Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.728231Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:74f28229b49f7d42c3aeee017a17f1444b953f9ff1fcfd5e81ee87dcdb774941","observation_id":"5f8b9b6d-ee6a-44b6-9fb2-c37d3c6a3108","resolution":{"observed_at":"2026-08-11T04:37:14.728231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.731871Z","title":"Srinivasan, Matthew Tancik, Jonathan T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.731871Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:9d335497838ba51303cff76f126cc605f45ffb677c7acd7ac188b9c8fcfdcbe1","observation_id":"26cdc14d-8f9b-4186-8e3d-eca183b36d4a","resolution":{"observed_at":"2026-08-11T04:37:14.731871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.735767Z","title":"Video probabilistic diffusion models in projected latent space","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.735767Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:aeec350b4a0a553ef35384a290b5a4ec512186079ffd882ed10d5da7c834811e","observation_id":"1cfdf55d-3754-499c-a59d-a0dcff3e2ac7","resolution":{"observed_at":"2026-08-11T04:37:14.735767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.739757Z","title":"Towards end-to-end generative modeling of long videos with memory-efficient bidirectional transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.739757Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:ec8a0e9bb1e4456ca95b4619fd0049d8175c62d7d150792ef637019692d796f1","observation_id":"ed4713e1-e138-4a54-a0d6-a55c607b859a","resolution":{"observed_at":"2026-08-11T04:37:14.739757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.744775Z","title":"Streamingt2v: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.744775Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:09d553387bbf742634adda5bdf933f381edcf5485c46a7750231129f3f1f8e72","observation_id":"42503dbb-4772-4626-87d6-e3c6cdc03858","resolution":{"observed_at":"2026-08-11T04:37:14.744775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.748917Z","title":"Vid-gpt: Introducing gpt-style autoregressive generation in video diffusion models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.748917Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:37dbbae13b00283776d1ece3a2d1a75ac51ce1886f668277daafb42131e52aaa","observation_id":"ce5f2492-ebb5-420a-8b07-136f55fc2c05","resolution":{"observed_at":"2026-08-11T04:37:14.748917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.753119Z","title":"Flexifilm: Long video generation with flexible conditions, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.753119Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:702feeca4f02146791df53d14ef47f9b65ca8271e6be6a46a80a853b0410f48b","observation_id":"faec5de8-142b-4706-9525-e9461a8ae33e","resolution":{"observed_at":"2026-08-11T04:37:14.753119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.756938Z","title":"Mora: Enabling generalist video generation via a multi-agent framework, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.756938Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:c982dfcba30ec0ae215bf44cd9e6c25b82cccb1d7b0725435878f045e8f05e57","observation_id":"0a691872-05e8-4712-b187-4c5bde993731","resolution":{"observed_at":"2026-08-11T04:37:14.756938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.760816Z","title":"Vidgen: Long-form text-to-video generation with temporal, narrative and visual consistency for high quality story-visualisation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.760816Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:ca8573cfc7ab95d83929e06d5d5eadf1c257437c346acf21751cc16ba1585664","observation_id":"abd7f13e-d49e-4ebf-8995-fbaa27bad587","resolution":{"observed_at":"2026-08-11T04:37:14.760816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.764885Z","title":"Bissyand, and Saad Ezzini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.764885Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:8081c5eb23fdd353ed1378a3fda17d41b2d9041a2bc9b68b65cc0b1cec6bc0a6","observation_id":"3fdc9612-8db6-496e-8e11-3ea6f1af96d3","resolution":{"observed_at":"2026-08-11T04:37:14.764885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.768889Z","title":"Kubrick: Multimodal agent collaborations for synthetic video generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.768889Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:c3cd2b55e7341cdd527478859b82a9f41a8b89edcb0f2c0f008f4713b3ab477a","observation_id":"3df02390-71d4-41d1-8fb6-fe2e817cad53","resolution":{"observed_at":"2026-08-11T04:37:14.768889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.772557Z","title":"Modelscope text-to-video technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.772557Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:eb3224b8fd0fbc8e007874b1f09dd9c14d4d0d466219cc7b8f074f0c4fddb5ad","observation_id":"6efd1475-3e4f-4d52-9704-cea6801df19d","resolution":{"observed_at":"2026-08-11T04:37:14.772557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.776147Z","title":"Free-bloom: zero-shot text-to-video generator with llm director and ldm animator","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.776147Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:c0174999c655e05d48897b7d199077286064943e16cee046a58dc67078aa0368","observation_id":"d1255750-54c6-49cf-92e6-f11883e31db6","resolution":{"observed_at":"2026-08-11T04:37:14.776147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.779257Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.779257Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:b4458521b5ba3bceec9ead9b317d841b366de2267865aa5ec97a670839ef199c","observation_id":"e012fc7e-558b-4ad8-9fe4-3f393f872eaf","resolution":{"observed_at":"2026-08-11T04:37:14.779257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.783124Z","title":"LLM-grounded video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.783124Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:b14b725e74f9353bcb3cd82c58a15fc10bedc17fb44898fdd8998ea2b17f87ad","observation_id":"62041886-b668-4390-bd61-c099e3b420b8","resolution":{"observed_at":"2026-08-11T04:37:14.783124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.787359Z","title":"Mevg: Multi-event video generation with text-to-video models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.787359Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:f48cb967495f6035ed4c995df6d7cf6f4a7df09f114aa624742d4280b7972f3b","observation_id":"d40aef87-2cf7-4a7b-bf98-e75a1218d6a6","resolution":{"observed_at":"2026-08-11T04:37:14.787359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.791354Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.791354Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:11712620983afac09f5d43bc4292d8b02202d48195b683bf72fe9003cd09724b","observation_id":"91f84484-2120-48d6-888c-7bca4ee84596","resolution":{"observed_at":"2026-08-11T04:37:14.791354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.796952Z","title":"Videomerge: Towards training-free long video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.796952Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:dea2d126c215e0f88fc474627fe553fe2c8599111c46bc01f66a98ed90ac39c6","observation_id":"e539ca34-483d-4f48-b056-be507e070be9","resolution":{"observed_at":"2026-08-11T04:37:14.796952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:37:14.801702Z","title":"Mevg: Multi-event video generation with text-to-video models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:14.801702Z"},"links":{"citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:93fab88b8efae618435d5ac376373a9e11575c97a901be12e83f396be36b3832","observation_id":"ede348e8-a4a3-42a1-8b65-f391622a7597","resolution":{"observed_at":"2026-08-11T04:37:14.801702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T03:58:30.119565Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":187},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 187 outbound references and 1 inbound Pith citation observation for arXiv:2412.18688."}