{"as_of":"2026-08-21T11:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42592a6a307aa93c0dc4f69849424bae419b77d44d95e26de04c059ef4bce552","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":44,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:40:30.397158Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T13:45:45.958520Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-12T13:29:59.077307Z","title":"Gen-L-Video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16199","last_updated":"2025-04-08T14:47:07Z","snapshot_observed_at":"2026-08-18T16:07:47.382138Z","submitted_at":"2024-11-25T08:55:41Z","title":"VIRES: Video Instance Repainting via Sketch and Text Guided Generation","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:59.077307Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2411.16199"},"observation_digest":"sha256:659c3ec57fcf8697e00ccdf0c9733e5e859dd26c5146e0ab0686880dc15e4db3","observation_id":"73fdab96-0d2b-4e16-bc40-035b3de460fb","resolution":{"observed_at":"2026-08-12T13:29:59.077307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-12T13:17:41.895638Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16375","last_updated":"2025-05-21T10:38:01Z","snapshot_observed_at":"2026-08-17T01:27:04.025030Z","submitted_at":"2024-11-25T13:33:41Z","title":"Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:17:41.895638Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2411.16375"},"observation_digest":"sha256:f4d738772584f57eb4bb7b86320691c713bc8f2de033665620b0cf8dab9fa9fe","observation_id":"6487a23f-d84f-4c4d-9561-9a022dbf9b4e","resolution":{"observed_at":"2026-08-12T13:17:41.895638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-12T12:58:57.299416Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-20T01:48:50.709132Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.299416Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:19bfbebaeb0ff079fa28f52d6554602d8408b031c2a856221537134a44742112","observation_id":"0f79c6ea-effe-4c7b-9f36-98830d650975","resolution":{"observed_at":"2026-08-12T12:58:57.299416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-12T04:32:44.493222Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01316","last_updated":"2025-03-29T08:56:56Z","snapshot_observed_at":"2026-08-16T11:24:37.253648Z","submitted_at":"2024-12-02T09:32:36Z","title":"Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:32:44.493222Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2412.01316"},"observation_digest":"sha256:0bd479067c5767b973d609f415d378d7dc4a26e865ef4e77c5fcb6886a34f64d","observation_id":"20f32d96-33db-4ea7-b333-4bff37593bd4","resolution":{"observed_at":"2026-08-12T04:32:44.493222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-11T20:55:02.174263Z","title":"Gen-L-Video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05263","last_updated":"2025-03-08T01:36:55Z","snapshot_observed_at":"2026-08-18T22:48:02.270695Z","submitted_at":"2024-12-06T18:52:20Z","title":"Mind the Time: Temporally-Controlled Multi-Event Video Generation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T20:55:02.174263Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2412.05263"},"observation_digest":"sha256:c36bcdede842df760d027e01fcb7bf0c2df1394b8d7913c3ac0b141ae0570ff2","observation_id":"00df8333-4747-4c99-9041-a7187aacedb5","resolution":{"observed_at":"2026-08-11T20:55:02.174263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-11T15:40:20.106573Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-19T16:28:33.825358Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:20.106573Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:2fa9925803873d617ddd3547c386773da882097fd0dec71c6cfeb7373f175a0f","observation_id":"9b01888a-52b5-423c-bad4-5dec7185c72f","resolution":{"observed_at":"2026-08-11T15:40:20.106573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-11T14:45:09.246274Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11710","last_updated":"2024-12-16T12:32:21Z","snapshot_observed_at":"2026-08-20T16:25:59.007466Z","submitted_at":"2024-12-16T12:32:21Z","title":"Re-Attentional Controllable Video Diffusion Editing","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T14:45:09.246274Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2412.11710"},"observation_digest":"sha256:2dcbaabf894453379cc03f5067172b53aba6be999eae9531145f1608006a19ee","observation_id":"86bebbff-4798-46bb-a95a-668f1a26e104","resolution":{"observed_at":"2026-08-11T14:45:09.246274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-11T13:15:28.534361Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16211","last_updated":"2024-12-17T23:00:42Z","snapshot_observed_at":"2026-08-15T19:50:50.194585Z","submitted_at":"2024-12-17T23:00:42Z","title":"Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T13:15:28.534361Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2412.16211"},"observation_digest":"sha256:02bfba986e176e9261d936a9009f74d6eeb7e58bc265bca91cd2c899a0c50831","observation_id":"f1ffa5b6-6822-4119-a09b-cc5bd2dd9021","resolution":{"observed_at":"2026-08-11T13:15:28.534361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-10T22:25:25.918741Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01790","last_updated":"2025-03-18T10:47:27Z","snapshot_observed_at":"2026-08-17T11:20:56.165062Z","submitted_at":"2025-01-03T12:45:22Z","title":"Ingredients: Blending Custom Photos with Video Diffusion Transformers","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:25.918741Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2501.01790"},"observation_digest":"sha256:3ddf1595a60018691ae0f11ce32a4255e798c791f251f57e7f42755a9614723f","observation_id":"3b99598a-eef6-4f32-9c61-f5bf50479eb1","resolution":{"observed_at":"2026-08-10T22:25:25.918741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-10T22:10:11.820062Z","title":"Gen-L-Video: multi-text to long video generation via temporal co-denoising,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02741","last_updated":"2025-01-06T03:19:15Z","snapshot_observed_at":"2026-08-17T12:06:25.629114Z","submitted_at":"2025-01-06T03:19:15Z","title":"Brick-Diffusion: Generating Long Videos with Brick-to-Wall Denoising","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:11.820062Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2501.02741"},"observation_digest":"sha256:bda5b58e1a7ad5942ffca6f8a9b2fd60cfa0a362f7aab436b6dfeae615aa4b25","observation_id":"eb94d4e0-667d-448b-b554-ef67122ec48b","resolution":{"observed_at":"2026-08-10T22:10:11.820062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-10T21:39:55.110079Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05484","last_updated":"2025-01-08T05:49:39Z","snapshot_observed_at":"2026-08-13T12:33:00.554766Z","submitted_at":"2025-01-08T05:49:39Z","title":"Tuning-Free Long Video Generation via Global-Local Collaborative Diffusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:39:55.110079Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2501.05484"},"observation_digest":"sha256:99262fdabeb4d15bb10562901c3cbcd8b7f3666a7da2ec6be9b952f9eab7d3d9","observation_id":"5b72075e-1e19-4e4d-bf50-7ea9f1ed0191","resolution":{"observed_at":"2026-08-10T21:39:55.110079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-10T20:14:50.831933Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09019","last_updated":"2025-01-15T18:59:15Z","snapshot_observed_at":"2026-08-15T07:38:31.716175Z","submitted_at":"2025-01-15T18:59:15Z","title":"Ouroboros-Diffusion: Exploring Consistent Content Generation in Tuning-free Long Video Diffusion","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T20:14:50.831933Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2501.09019"},"observation_digest":"sha256:6d6e6d1f10beab5588b0f6695915200737a48cf3d98e2f7acd943f714931eefa","observation_id":"c201e375-546d-4903-b52e-12eca4991ba0","resolution":{"observed_at":"2026-08-10T20:14:50.831933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-08T20:12:29.598188Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05130","last_updated":"2025-07-29T07:31:59Z","snapshot_observed_at":"2026-08-21T07:59:48.661314Z","submitted_at":"2025-02-07T18:02:47Z","title":"Latent Swap Joint Diffusion for 2D Long-Form Latent Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T20:12:29.598188Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2502.05130"},"observation_digest":"sha256:325d9c9b4107527d7c1a8c314e4f6f909e72a50c3d2b3bb68da5a85f0d2b6519","observation_id":"5658d19e-b6df-481d-9d83-c733e44bf1db","resolution":{"observed_at":"2026-08-08T20:12:29.598188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2503.06310","last_updated":"2026-05-19T15:23:11Z","snapshot_observed_at":"2026-08-19T04:30:05.716470Z","submitted_at":"2025-03-08T19:04:36Z","title":"Scene-Action Prompt Fusion for Coherent Text-to-Video Storytelling","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T00:07:39.286486Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2503.06310"},"observation_digest":"sha256:3370ebcc38127f74491caabb31c5cd2d7ff569cbc47b63df18834badedb7ed56","observation_id":"f2a4df6d-76ad-4764-9c3b-2020dd432e00","resolution":{"observed_at":"2026-05-23T00:12:17.879039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-08-15T15:00:19.916941Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T23:05:17.201790Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2503.19325"},"observation_digest":"sha256:fbcf03d32e636d6ffb5d862818ce0211eb27a9bb1e52534f4095f9beed6e16ff","observation_id":"90623b86-060a-42db-ae5d-f655c1ee9ade","resolution":{"observed_at":"2026-05-16T23:05:17.276943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-16T12:40:30.397158Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12048","last_updated":"2025-04-16T13:04:01Z","snapshot_observed_at":"2026-08-19T18:10:16.190206Z","submitted_at":"2025-04-16T13:04:01Z","title":"Modular-Cam: Modular Dynamic Camera-view Video Generation with LLM","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:30.397158Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2504.12048"},"observation_digest":"sha256:8d54dc0848674a93e9a48e9ebee3455c850e5a9f47b96c0c84ab9d86c43add24","observation_id":"b483865c-2068-41ed-9cff-d5ffa912eca8","resolution":{"observed_at":"2026-08-16T12:40:30.397158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-16T04:29:31.042415Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01172","last_updated":"2025-05-02T10:27:58Z","snapshot_observed_at":"2026-08-19T03:16:17.940351Z","submitted_at":"2025-05-02T10:27:58Z","title":"FreePCA: Integrating Consistency Information across Long-short Frames in Training-free Long Video Generation via Principal Component Analysis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:29:31.042415Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2505.01172"},"observation_digest":"sha256:64eb2c03168c3487315217b666c807695d75c0c6cd266b6895e2de9088b34b2b","observation_id":"2ff4c7d0-8da1-44f5-ab23-911eadd90650","resolution":{"observed_at":"2026-08-16T04:29:31.042415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2505.16819","last_updated":"2026-05-19T15:22:52Z","snapshot_observed_at":"2026-08-01T07:12:14.758494Z","submitted_at":"2025-05-22T15:54:42Z","title":"Character-Centered Dialogue Generation from Scene-Level Prompts","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T13:31:43.083678Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2505.16819"},"observation_digest":"sha256:84d2bdf91cdd3ec37a48fe4a9ec65f79e87a4a6c29aa4ddfcc599cc213deca18","observation_id":"05f35cc5-2492-4ada-89cd-8018d52cd082","resolution":{"observed_at":"2026-05-22T13:34:53.596659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-07T13:52:23.659573Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-15T04:39:04.819728Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.659573Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:669a98dc8d14012e1b48ebfdada14702feaac31f2aaa07552921bf1c8f30a939","observation_id":"d5bea886-b2d0-455b-af90-1c8903bcb576","resolution":{"observed_at":"2026-08-07T13:52:23.659573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-07T11:54:18.828455Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01144","last_updated":"2025-06-04T07:45:25Z","snapshot_observed_at":"2026-08-17T04:56:26.147278Z","submitted_at":"2025-06-01T19:55:33Z","title":"FlowMo: Variance-Based Flow Guidance for Coherent Motion in Video Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:18.828455Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2506.01144"},"observation_digest":"sha256:7feaec30b938efd980698f89a2fd99faa29f32605467871124117b740dedfb02","observation_id":"3b43765b-a46a-4d6e-9428-248c8e95320e","resolution":{"observed_at":"2026-08-07T11:54:18.828455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-07T11:27:13.157728Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising.arXiv preprint arXiv:2305.18264, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02497","last_updated":"2025-06-03T06:25:00Z","snapshot_observed_at":"2026-08-13T23:28:17.412092Z","submitted_at":"2025-06-03T06:25:00Z","title":"LumosFlow: Motion-Guided Long Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:27:13.157728Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2506.02497"},"observation_digest":"sha256:56369981bec5978cdfaf7859348f25199d55082d16885a332e9fb43a2eb68c86","observation_id":"1b31f71e-ad83-4f65-b2de-4bd54e44f6b5","resolution":{"observed_at":"2026-08-07T11:27:13.157728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-07T10:51:59.034693Z","title":"arXiv preprint arXiv:2305.18264 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04225","last_updated":"2025-06-04T17:59:04Z","snapshot_observed_at":"2026-08-17T14:52:52.050125Z","submitted_at":"2025-06-04T17:59:04Z","title":"Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:51:59.034693Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2506.04225"},"observation_digest":"sha256:b3fae69a4da06503883f18c8dc3528d63f18658d5ed0db2b21425a49c85e60a4","observation_id":"914e6d65-5301-45cf-9962-ec1d1616d3f2","resolution":{"observed_at":"2026-08-07T10:51:59.034693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-06T21:29:50.767973Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24113","last_updated":"2025-06-30T17:56:35Z","snapshot_observed_at":"2026-08-13T14:57:11.233080Z","submitted_at":"2025-06-30T17:56:35Z","title":"Epona: Autoregressive Diffusion World Model for Autonomous Driving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:29:50.767973Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2506.24113"},"observation_digest":"sha256:6cbcfe6ff0fd14dbb0bd882f092b7a1842482f289e71b9ded39b8286de58ec9f","observation_id":"cdb76e04-ca4f-49ab-a578-ababe0539eda","resolution":{"observed_at":"2026-08-06T21:29:50.767973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-06T21:28:19.447426Z","title":"Gen- l-video: Multi-text to long video generation via temporal co- denoising,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00162","last_updated":"2025-06-30T18:11:21Z","snapshot_observed_at":"2026-08-16T18:58:53.286701Z","submitted_at":"2025-06-30T18:11:21Z","title":"FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:28:19.447426Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2507.00162"},"observation_digest":"sha256:3441d4512c23944e6e7152dc932dabd4f6f4d2bde61c00556219d6ad538f54ef","observation_id":"9d2747e3-76a0-4025-a990-8618a86839b0","resolution":{"observed_at":"2026-08-06T21:28:19.447426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-06T16:39:29.844730Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12952","last_updated":"2025-07-17T09:46:43Z","snapshot_observed_at":"2026-08-17T17:09:42.493624Z","submitted_at":"2025-07-17T09:46:43Z","title":"LoViC: Efficient Long Video Generation with Context Compression","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T16:39:29.844730Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2507.12952"},"observation_digest":"sha256:35651b4a12bd65dad8f1f0cb96c1e4dd677e7ca15297b19c2fb051eb8087e538","observation_id":"9363dd6f-8a08-4e47-9055-b5e2b90c59f8","resolution":{"observed_at":"2026-08-06T16:39:29.844730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-06T15:28:30.321287Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-20T14:28:57.650259Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.321287Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:7c72e526b4d80702ad41e0eee5acd00733c6265077f2b780391215c91d2d58d0","observation_id":"05b365b8-e324-4737-876f-a97c2bcbaab0","resolution":{"observed_at":"2026-08-06T15:28:30.321287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-05T22:03:24.625927Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07597","last_updated":"2025-08-15T09:27:47Z","snapshot_observed_at":"2026-08-17T23:06:11.327925Z","submitted_at":"2025-08-11T03:56:23Z","title":"ShoulderShot: Generating Over-the-Shoulder Dialogue Videos","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:24.625927Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2508.07597"},"observation_digest":"sha256:93b25c62f42fc3292d0a9a273776b503cb8fdb3ffb59c8e2c53c07ba51fd6dd9","observation_id":"a4d2d6ed-b7e5-4eba-90b7-f899695b572d","resolution":{"observed_at":"2026-08-05T22:03:24.625927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-15T17:42:41.473093Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-18T02:40:00.948380Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.473093Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:5ce4041cf526b9a58ba4fa2143ff3f45cecf5b598eb2f53aacb627daebbbfffd","observation_id":"2f87002f-248d-49e6-a418-524b8d753cb8","resolution":{"observed_at":"2026-08-15T17:42:41.473093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-05T18:29:04.459945Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14609","last_updated":"2025-08-20T10:51:24Z","snapshot_observed_at":"2026-08-15T03:17:51.371473Z","submitted_at":"2025-08-20T10:51:24Z","title":"AnchorSync: Global Consistency Optimization for Long Video Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T18:29:04.459945Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2508.14609"},"observation_digest":"sha256:e956e2c13daa42658caefdf0c5c47bbfea35b859dd9aa76da351cc5e73e3f270","observation_id":"d2667054-549a-4ea1-a644-3b69a5e24a8e","resolution":{"observed_at":"2026-08-05T18:29:04.459945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-05T15:19:37.229734Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.229734Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:a3c003f901df1e75dc5a2105c0d86e64c42e7e941af31d11483750b7afba2785","observation_id":"d25195cc-2719-4df0-8b08-247ecd523f08","resolution":{"observed_at":"2026-08-05T15:19:37.229734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2510.20206","last_updated":"2026-05-14T08:53:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-23T04:45:09Z","title":"RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-18T05:13:42.934115Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2510.20206"},"observation_digest":"sha256:d9879611c2758151cf7b8ed5cc4200ec6ab8dbb2b920e5f6c7d4dd9559297da6","observation_id":"ec570185-0348-40cd-a9db-958e063ce329","resolution":{"observed_at":"2026-05-18T05:15:54.494414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-03T13:13:47.352812Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising.arXiv preprint arXiv:2305.18264, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.00126","last_updated":"2026-07-17T22:35:37Z","snapshot_observed_at":"2026-08-21T00:25:05.962081Z","submitted_at":"2025-12-31T22:03:19Z","title":"Compositional Diffusion with Guided Search for Long-Horizon Planning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T13:13:47.352812Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2601.00126"},"observation_digest":"sha256:95b14ca90d9886508fa3c8343c7579e896d9993abb173fb8249e1c899479db05","observation_id":"2d75952f-1bbc-4d0a-a75e-9409d305f239","resolution":{"observed_at":"2026-08-03T13:13:47.352812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2605.06509","last_updated":"2026-05-07T16:21:34Z","snapshot_observed_at":"2026-08-20T09:53:07.538977Z","submitted_at":"2026-05-07T16:21:34Z","title":"FreeSpec: Training-Free Long Video Generation via Singular-Spectrum Reconstruction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T13:11:46.079614Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2605.06509"},"observation_digest":"sha256:588bad0334e8962511ba7118200a008aeeae71b0514df81eff981e3753a2c4bd","observation_id":"e897bc2c-fedd-4042-a38f-b5f8dc4ae394","resolution":{"observed_at":"2026-05-11T18:56:07.721119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2605.06512","last_updated":"2026-05-07T16:22:21Z","snapshot_observed_at":"2026-08-15T16:32:41.066580Z","submitted_at":"2026-05-07T16:22:21Z","title":"DCR: Counterfactual Attractor Guidance for Rare Compositional Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T13:06:56.964670Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2605.06512"},"observation_digest":"sha256:57758dd387e3fadcb7e25b871b0d4760f6a3a3c353c36a88631a1dfa74a9a470","observation_id":"75a45d37-569e-4ab3-8d10-27a78811c716","resolution":{"observed_at":"2026-05-11T19:01:10.958565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2605.10543","last_updated":"2026-05-25T17:58:28Z","snapshot_observed_at":"2026-08-13T06:48:59.100863Z","submitted_at":"2026-05-11T13:23:14Z","title":"TIE: Time Interval Encoding for Video Generation over Events","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T04:26:23.558427Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2605.10543"},"observation_digest":"sha256:f06d2f238554dd80cc1fc6966f0a38ebbdae3dc57d64be2c2968c6b96dc1cf38","observation_id":"015a5753-e019-4cc1-9b6c-81bf1ab8b586","resolution":{"observed_at":"2026-05-12T06:16:28.030354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2605.10543","last_updated":"2026-05-25T17:58:28Z","snapshot_observed_at":"2026-08-13T06:48:59.100863Z","submitted_at":"2026-05-11T13:23:14Z","title":"TIE: Time Interval Encoding for Video Generation over Events","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T22:47:55.768380Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2605.10543"},"observation_digest":"sha256:ad926610de25a7d349d65ecb2ae667c38c5f614d67c8dbb30b541486d4c7558b","observation_id":"af38671f-d523-4207-8a3f-f6932fd7b436","resolution":{"observed_at":"2026-07-01T13:45:45.960362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2605.18233","last_updated":"2026-05-18T11:28:45Z","snapshot_observed_at":"2026-08-16T14:49:25.665753Z","submitted_at":"2026-05-18T11:28:45Z","title":"Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T10:56:16.054496Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2605.18233"},"observation_digest":"sha256:2d051ce7ff20fa2b04c16b6fb0085b7ed2acc7ba96c0a19c24afd0c16fdd7eda","observation_id":"79e42a55-fa65-4bc7-b59c-3d1c310a73e7","resolution":{"observed_at":"2026-05-20T10:58:13.904551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2605.23508","last_updated":"2026-05-22T11:16:05Z","snapshot_observed_at":"2026-08-18T22:11:25.293679Z","submitted_at":"2026-05-22T11:16:05Z","title":"DrawVideo: Generating Long Video from Storyboard Keyframe Sketches","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T02:40:00.873188Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2605.23508"},"observation_digest":"sha256:2b00cf293f603023e77d9bc85aafebbef112237c32cacba408f038a03b70b12c","observation_id":"bbe0930d-3439-4be7-8d08-c14ab80f2ca2","resolution":{"observed_at":"2026-05-25T02:40:14.549398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-08-07T14:51:20.539252Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:739de49686bd507cfad3acf367090379daeb1b40f042cb4bb254f3dac624283b","observation_id":"9b2d46f0-9827-4cb1-9f7a-9c650d46af2c","resolution":{"observed_at":"2026-06-28T23:12:46.608468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2606.00793","last_updated":"2026-06-08T08:58:38Z","snapshot_observed_at":"2026-08-17T02:34:17.615365Z","submitted_at":"2026-05-30T16:17:33Z","title":"MBench: A Comprehensive Benchmark on Memory Capability for Video World Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T19:04:58.672464Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2606.00793"},"observation_digest":"sha256:fd7f8108540faa0c90c5fc0b199e331fe9130b84c5c0eeea5999d634a55a0681","observation_id":"3e2224ea-c61a-490d-88c8-980f2bb8fb53","resolution":{"observed_at":"2026-06-28T19:22:35.077252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2606.00837","last_updated":"2026-05-30T18:26:53Z","snapshot_observed_at":"2026-08-14T02:48:51.790370Z","submitted_at":"2026-05-30T18:26:53Z","title":"Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T18:24:18.903215Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2606.00837"},"observation_digest":"sha256:09c0b3614eb753e322071f3417b37677a7e4c06301ef2566dd06a421b7b13b2e","observation_id":"c583a004-f2ae-4cee-abbc-708573ce4477","resolution":{"observed_at":"2026-06-28T20:42:37.730813Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-01T22:13:29.997190Z","title":"arXiv preprint arXiv:2305.18264 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15849","last_updated":"2026-07-17T11:07:07Z","snapshot_observed_at":"2026-08-15T21:39:55.982766Z","submitted_at":"2026-07-17T11:07:07Z","title":"Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T22:13:29.997190Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2607.15849"},"observation_digest":"sha256:55cc3ff5c5b058a0a109280c73261cc68f70efb429d57768a08820d4403face8","observation_id":"9692a55f-df01-4033-9270-53051d51eabd","resolution":{"observed_at":"2026-08-01T22:13:29.997190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-01T10:04:31.470364Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising.arXiv preprint arXiv:2305.18264,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20368","last_updated":"2026-07-24T08:16:28Z","snapshot_observed_at":"2026-08-18T04:58:10.558807Z","submitted_at":"2026-07-22T16:59:23Z","title":"Self Gradient Forcing: Native Long Video Extrapolation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T10:04:31.470364Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2607.20368"},"observation_digest":"sha256:723a793ec1c17352412450415f9a879322b50ff3eeecb483264d53d92a99a61d","observation_id":"8704be00-5a6b-4ac3-bb9a-8ddde7b31e4b","resolution":{"observed_at":"2026-08-01T10:04:31.470364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-30T23:29:03.468271Z","title":"arXiv preprint arXiv:2305.18264 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26706","last_updated":"2026-07-29T09:52:20Z","snapshot_observed_at":"2026-08-16T20:11:36.756442Z","submitted_at":"2026-07-29T09:52:20Z","title":"TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-30T23:29:03.468271Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2607.26706"},"observation_digest":"sha256:9792f15c46593ca317849a455d1007b786e13fe427acca6eea88021c2433ed5b","observation_id":"35d94627-f417-41eb-88f7-2719dbe550be","resolution":{"observed_at":"2026-07-30T23:29:03.468271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.18264/citation-record","integrity":"/paper/2305.18264/integrity","json":"/paper/2305.18264/citation-record.json","paper":"/paper/2305.18264"},"outbound":[],"paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T16:07:07.101501Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 44 inbound Pith citation observations for arXiv:2305.18264."}