{"as_of":"2026-08-12T22:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9fe26c8e49671a2031cce09b50f5c817a25b1be651fe912c9fde1e8094bbc340","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:11:52.136614Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.18668/citation-record","integrity":"/paper/2411.18668/integrity","json":"/paper/2411.18668/citation-record.json","paper":"/paper/2411.18668"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T11:11:52.035699Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.035699Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:536b02205da129e091ece1db2c3573294b34b9acae6a6ea10b62ca4d8dbfeaaf","observation_id":"6deccf3c-9644-4f84-8d6c-7246b6df6751","resolution":{"observed_at":"2026-08-12T11:11:52.035699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.040300Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.040300Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:ab50edfcafbe492f0f34745eead36984ee71e492454ff4a6d68fdc5791dc47a8","observation_id":"d2adc6c2-350f-4cf7-b45a-19b43094854b","resolution":{"observed_at":"2026-08-12T11:11:52.040300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.043918Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffu- sion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.043918Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:3eda9ab4cd6be37bed7f0278be2d81830288a1bddc0043e6b8e224233e43f659","observation_id":"ff646f98-332d-4a4c-8793-f853c87eec05","resolution":{"observed_at":"2026-08-12T11:11:52.043918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.377300Z","title":"Control-a- video: Controllable text-to-video diffusion models with mo- tion prior and reward feedback learning, 2024","venue":null,"work_id":"546d1710-46a5-4372-b2a1-89fc78f4a626","year":2024},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.047471Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:01e896094ebbaa9f8103c5dc9288897b8a2ca731a5ebe933e25996bd978711f3","observation_id":"bc0ed4ac-52f3-495d-b810-f86a23f3bde9","resolution":{"observed_at":"2026-08-12T11:11:52.381472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.367332Z","title":"Generative adversarial nets","venue":null,"work_id":"ef7e6ff2-71bf-4372-9709-ec3120c8f750","year":2014},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.050893Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:022878c0cacb7f70b20c4de5bafe5d0b84e7dfb78f5dad1e54235aaa84c794c2","observation_id":"b1dd4b0d-9967-4a93-9e36-696aa6d95008","resolution":{"observed_at":"2026-08-12T11:11:52.370925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-12T11:11:52.054677Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.054677Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:56eff6776ee68def9ca9d9c87d212b49b196d8f8bfc7d7ab45f56d320a3432e3","observation_id":"9de4b07a-3c29-4c95-a8c1-e384d9385910","resolution":{"observed_at":"2026-08-12T11:11:52.054677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.358201Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"dd96ef05-1d5b-4d7a-aa52-d575ef49fb57","year":2020},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.058474Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:8a99e977584388df9dbb03a6e2f5b275ab537b2378a688ef49bbaca8601df0e9","observation_id":"ef0e1c46-7740-42bf-8405-1ccd95fd6cac","resolution":{"observed_at":"2026-08-12T11:11:52.361551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.061484Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.061484Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:50171508be5c10347434d56871c62200a1ef31de34c8abc32b80bf903294e2ea","observation_id":"895c75ae-0d8c-41c1-81ac-8bb628799d9a","resolution":{"observed_at":"2026-08-12T11:11:52.061484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.341693Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":"263a526d-0256-49ab-9a3e-9792233db6e5","year":2022},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.064876Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:5a8cc901bfa3bd9b3632743018a4d0e42a967caa43e07676299b8a64afc1b968","observation_id":"33a7be06-7b5e-4eb1-bfb5-fae8ede5089e","resolution":{"observed_at":"2026-08-12T11:11:52.346238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11473","last_updated":"2024-11-03T12:40:41Z","snapshot_observed_at":"2026-08-10T11:24:16.483474Z","submitted_at":"2024-05-19T07:48:41Z","title":"FIFO-Diffusion: Generating Infinite Videos from Text without Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11473","snapshot_observed_at":"2026-08-12T11:11:52.068105Z","title":"Fifo-diffusion: Generating infinite videos from text without training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.068105Z"},"links":{"cited_paper":"/paper/2405.11473","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:c18a2d1dd558f5780ba348cd12a4b10274bceac9ec00c65a8d7d252d52123e4a","observation_id":"773a7575-2607-48b2-b67c-115f1c664f0c","resolution":{"observed_at":"2026-08-12T11:11:52.068105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-12T11:11:52.072084Z","title":"Videopoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.072084Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:7fb3ffa9a842756b14a86a6417ca6408a2ec2cbb8d5eda3d334e6a61ea6a625c","observation_id":"0dc10f3c-39fc-4eb2-b484-f002e9a88bcf","resolution":{"observed_at":"2026-08-12T11:11:52.072084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.331711Z","title":"Open-sora-plan, 2024","venue":null,"work_id":"35442581-1837-4e30-a265-d8b2979f406f","year":2024},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.075833Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:6adf57f2f4c39cfe41b62a8212ab9fbf5f435bb692ed2318b4d817f1355450eb","observation_id":"f97c8577-1f85-4e29-93db-3b1197e4681f","resolution":{"observed_at":"2026-08-12T11:11:52.335102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.322212Z","title":"aesthetic-predictor","venue":null,"work_id":"03613282-4f90-4e75-bdc7-34a8f360a499","year":2022},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.078862Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:fc25086885dfd3f0c68c60be46a9169385d2621271bf36c564d9e58cc5defb9f","observation_id":"c2e80aca-341b-472d-9b7f-e1fee4cd7279","resolution":{"observed_at":"2026-08-12T11:11:52.325605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.312117Z","title":"Amt: All-pairs multi-field transforms for efficient frame interpolation","venue":null,"work_id":"2b1c71e2-b900-4fe4-b3ba-e1113aa79653","year":2023},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.082099Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:4e3cda7f9d1731fb8c3d946497ed0dc2f822740e8ebfda2efcf322650cbd0bf3","observation_id":"d18bfcda-a372-4a92-8923-cf0bc47cf535","resolution":{"observed_at":"2026-08-12T11:11:52.315535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09778","last_updated":"2022-10-31T09:05:25Z","snapshot_observed_at":"2026-08-10T13:42:46.496202Z","submitted_at":"2022-02-20T10:37:52Z","title":"Pseudo Numerical Methods for Diffusion Models on Manifolds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09778","snapshot_observed_at":"2026-08-12T11:11:52.085150Z","title":"Pseudo numerical methods for diffusion models on manifolds.arXiv preprint arXiv:2202.09778, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.085150Z"},"links":{"cited_paper":"/paper/2202.09778","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:9d85dabbfda8e9870bb484dbcb75752cf5c37df8de2b86fe7f321c1e8c9cbe46","observation_id":"3cda880c-f228-42f2-8032-ac04a190fbc5","resolution":{"observed_at":"2026-08-12T11:11:52.085150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.088566Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.088566Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:731618f45ce2c43708bcb644045538be556dba0bd928f5dd67dd708df8262edc","observation_id":"9327c4d9-2c11-4f41-9001-a7787ab9e142","resolution":{"observed_at":"2026-08-12T11:11:52.088566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.092574Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.092574Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:ceb8e43efadb494fe1d4ab10ffdf604e9aa3f931a8890efa6d1b5701103714d8","observation_id":"e1c6c4fa-c7c1-4d74-875a-5fd72fa8fdb9","resolution":{"observed_at":"2026-08-12T11:11:52.092574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.096109Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.096109Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:347f6be472d96540b413030034bb1c3bda28bc14cae15c30d2ae91b46ab8fff0","observation_id":"5a06b7bc-f90e-4989-9590-ab77a60d5514","resolution":{"observed_at":"2026-08-12T11:11:52.096109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.099505Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.099505Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:a1cd61e17c7e5feab6d822dcad1b1ed28efb6f9ed8d205a5ddf7b26879d148b5","observation_id":"628339fd-d702-4bbc-9bc4-b73dbda6c8d3","resolution":{"observed_at":"2026-08-12T11:11:52.099505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-11T14:52:19.474879Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-12T11:11:52.102699Z","title":"Consisti2v: Enhanc- ing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.102699Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:98646a7688361bfa30b25a640b5c50ad8e95801f87898d45d956df5f0f42cfa2","observation_id":"7a508ef1-e9d1-41a8-8578-68e9141c205f","resolution":{"observed_at":"2026-08-12T11:11:52.102699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.106213Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.106213Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:11953f85255781310b281e720c6777018d8471f3e2c23631bb636ae89de93b1a","observation_id":"8aa0ef68-bdc1-41ce-947f-08be4808a00f","resolution":{"observed_at":"2026-08-12T11:11:52.106213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.109996Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.109996Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:41d92414721415ae95bd79646fafb223a4a30d497acb7569f335378d91f04625","observation_id":"29ad6fe1-c1e2-40c2-93b5-b31a21450ee9","resolution":{"observed_at":"2026-08-12T11:11:52.109996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-12T11:11:52.113092Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.113092Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:a97c472aa0a254ec129e5e49983ec9854822675fe085f4026ab425ade75801ff","observation_id":"8a3b6530-ecb4-45d7-b5e0-a4de2393a5a0","resolution":{"observed_at":"2026-08-12T11:11:52.113092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-12T17:57:54.262483Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-12T11:11:52.116505Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.116505Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:7092618ce2bb7117c9099677711f27c9c9c540b09b04f88f7dffe48035fa67f8","observation_id":"6f113df8-9ceb-412a-bf98-5e03a32bc4ce","resolution":{"observed_at":"2026-08-12T11:11:52.116505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-12T11:11:52.120124Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.120124Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:6b2fa1ec4579cdf1b57411f84126015d278b67619ee91d08c8e8ebeb732a48ff","observation_id":"f95ad6d7-4238-493b-a81e-e6cfcfefc142","resolution":{"observed_at":"2026-08-12T11:11:52.120124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.09814","last_updated":"2022-08-12T04:41:05Z","snapshot_observed_at":"2026-08-12T20:30:42.898718Z","submitted_at":"2022-07-20T10:55:55Z","title":"NUWA-Infinity: Autoregressive over Autoregressive Generation for Infinite Visual Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.09814","snapshot_observed_at":"2026-08-12T11:11:52.123640Z","title":"Nuwa-infinity: Autoregressive over autoregressive generation for infinite visual synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.123640Z"},"links":{"cited_paper":"/paper/2207.09814","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:75e1c6dee34935cdf9688f7633c421c3dc812a3c110e438c737225b8c465e02d","observation_id":"b605e088-94a8-4fff-9b43-0cfd0b6ac3b7","resolution":{"observed_at":"2026-08-12T11:11:52.123640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.268981Z","title":"Freeinit: Bridging initialization gap in video dif- fusion models","venue":null,"work_id":"5ac6c873-b318-433d-8cac-57f45284ee69","year":2025},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.126830Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:521d94edd18300348d63fec2cdceaec7a4d77b99f39cb0aeacba1d2c2b87af15","observation_id":"73b0e0a6-9475-492b-a316-e2de0df150e6","resolution":{"observed_at":"2026-08-12T11:11:52.273333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-12T11:11:52.130074Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.130074Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:bb4d6ba95a3a43906ef2ed3dea41d16248d18cd8acdd2122d4ffc25f718dc192","observation_id":"bac21d8c-b2d1-4039-bb4b-a8c678fc9ac0","resolution":{"observed_at":"2026-08-12T11:11:52.130074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:52.257216Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"d6b7c20c-5fa2-4c74-b1f2-5134b84242ad","year":2023},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.133459Z"},"links":{"citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:5a155751ebc3bfe752ad21f817bf234588632c94f4adc336838eb70c0ae24ce9","observation_id":"efceeb06-a411-4c85-ab80-80fa2faac988","resolution":{"observed_at":"2026-08-12T11:11:52.262280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-12T11:11:52.136614Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.136614Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:a8dc7b97bcf3677c98a39c94258b12bf3b21658cc5c41aef2e298843ddf5bfb6","observation_id":"afdcb13c-091e-438a-b927-0962ed38e2d7","resolution":{"observed_at":"2026-08-12T11:11:52.136614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T20:31:14.989600Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2411.18668."}