{"as_of":"2026-08-08T04:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6949a1416f65ea70db6a71f7d1200d6976d7e549220e5e8560eb3c60074cffe7","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:52:24.986017Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:39:33.443014Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T16:39:34.724653Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"cited_work":{"arxiv_id":"2505.20827","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20827","snapshot_observed_at":"2026-08-06T16:39:34.724653Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","venue":"cs.CV","work_id":"754c9ce9-ac48-4861-a9b2-ec051c8e8b59","year":2025},"citing_paper":{"arxiv_id":"2507.12952","last_updated":"2025-07-17T09:46:43Z","snapshot_observed_at":"2026-08-07T11:02:23.505503Z","submitted_at":"2025-07-17T09:46:43Z","title":"LoViC: Efficient Long Video Generation with Context Compression","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-06T16:39:33.443014Z"},"links":{"cited_paper":"/paper/2505.20827","citing_paper":"/paper/2507.12952"},"observation_digest":"sha256:f06d0be05c1c0543bbd73859d370916b48b15a63396c4ccf64f5285fdcbbb861","observation_id":"672da83a-bf59-448e-b9c2-ffe3a00488e4","resolution":{"observed_at":"2026-08-06T16:39:34.798842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20827/citation-record","integrity":"/paper/2505.20827/integrity","json":"/paper/2505.20827/citation-record.json","paper":"/paper/2505.20827"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:28.365288Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":"24cf9388-e95a-4acc-9e58-f3b26a77c6c3","year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:20.619862Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:4d89d2c27d048e3df075f03bd968cfe2811e6a11da919451a972a23052437d62","observation_id":"326a447c-60ba-46d3-a187-c57f939e92e8","resolution":{"observed_at":"2026-08-07T13:52:28.475980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:52:20.736392Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:20.736392Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:af91f560b5867da97903d51d35012d0a2bdb77cc1b7633f1ff39f2fa78ffac6a","observation_id":"d58735dd-48a3-4813-89ea-9807fa66f72b","resolution":{"observed_at":"2026-08-07T13:52:20.736392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:20.841396Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:20.841396Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:79bae0b0a7a5147a03c34fdb342b0286cb730b969731ab5afeba5d22e05bde04","observation_id":"a57090df-d86f-46bc-bfce-6382860c7b8d","resolution":{"observed_at":"2026-08-07T13:52:20.841396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:20.907024Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:20.907024Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:f0e42f63b39a3f7b7d5e3dd0d20a56dde902a0ba078d3c98eb9ccf1ea2f9b5e5","observation_id":"1d51cc5a-4ff0-4606-a8f0-7645f5a55768","resolution":{"observed_at":"2026-08-07T13:52:20.907024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:28.145922Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"5f9abe1e-c801-4192-baea-be12c680524c","year":2015},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:20.983081Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:a002a316e4137844a75cc28f968a8d7e3af2ddfbec2054aa453c7e3c6fdf870a","observation_id":"44bba26c-5ef4-4aac-a2ab-af2857f75a54","resolution":{"observed_at":"2026-08-07T13:52:28.241900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:21.064096Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.064096Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:386cfc59a76a61627b2c1b3477d866cb2da5026a550f8d1dbddedc8e90976bfb","observation_id":"c3721de0-7be4-461d-a563-a61dbd409232","resolution":{"observed_at":"2026-08-07T13:52:21.064096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-08-07T13:52:21.230585Z","title":"Skyreels-v2: Infinite-length film generative model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.230585Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:d1eddbeeabd79026ab92232e02fd08a35dada9305b0d7431d703354d5575fbf4","observation_id":"3038fb96-a49c-4bb0-a81f-681711bf0412","resolution":{"observed_at":"2026-08-07T13:52:21.230585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:27.982064Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"3560005e-4dbc-4c38-91dd-2e2fca114de7","year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.313961Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:5aea0ef6b3ee4e6fd478897c0de515d3e7d6249088ad577d5d679fd6512db75b","observation_id":"f2cd86fe-fcb3-4001-a2cc-2ac94e8811e4","resolution":{"observed_at":"2026-08-07T13:52:28.033266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:27.819022Z","title":"Learning temporal coherence via self-supervision for gan-based video generation","venue":null,"work_id":"a677b598-2a29-4eb5-8773-727b2b06894e","year":2020},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.429053Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:f1eed0705e74a538b8b9c8a0cbb808dfa11520db65fbb16b0f115c560991145c","observation_id":"b2f7a23e-1389-4327-b6fa-4601eda84a77","resolution":{"observed_at":"2026-08-07T13:52:27.875131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:27.669453Z","title":"Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"f798df6d-bd21-48de-abee-fe0ea865718f","year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.543209Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:29917067b4234b0cd36a5f432d16350b46c8511c449e6ebf976ba4005df977f4","observation_id":"15b9771c-e22f-4231-adeb-d36464455b75","resolution":{"observed_at":"2026-08-07T13:52:27.757449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T13:52:21.675607Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.675607Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:4414ceb32131ef069da497b4b6e0b2ef67faaf4d1bae93819a30e737d56111b8","observation_id":"fa7f08fb-4ff9-4ff0-b7f1-7d20d9a4f1f1","resolution":{"observed_at":"2026-08-07T13:52:21.675607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-07T17:06:18.944213Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-07T13:52:21.800462Z","title":"Long context tuning for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.800462Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:fb174b8878cc476068286d5287785eea8ebb1b0999fc16d66e0c49aa6e9e2a0c","observation_id":"b625c430-1f3c-43d7-ab62-2dd8f00864fd","resolution":{"observed_at":"2026-08-07T13:52:21.800462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-06T14:42:35.046089Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-07T13:52:21.866461Z","title":"Streamingt2v: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.866461Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:51db32055432fc0736823eaebe42234bb80dba35496c49f9cdf664c07f53247c","observation_id":"80296d13-3267-4b87-99b6-ede1ccec4070","resolution":{"observed_at":"2026-08-07T13:52:21.866461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:27.524620Z","title":"Autoregressive diffusion models","venue":null,"work_id":"c8152d05-1fcc-4087-9cd6-06e6a264139c","year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:21.937109Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:759f8b89130a025cf5da333c437960a3b06aac8ff0f0e54e292ea4ca728d412c","observation_id":"438697a2-2e0d-43c2-b8ab-abc715c43277","resolution":{"observed_at":"2026-08-07T13:52:27.602519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11251","last_updated":"2025-03-14T10:01:55Z","snapshot_observed_at":"2026-08-07T17:04:28.194667Z","submitted_at":"2025-03-14T10:01:55Z","title":"Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11251","snapshot_observed_at":"2026-08-07T13:52:22.021206Z","title":"Step-video-ti2v technical report: A state-of-the-art text-driven image-to-video generation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.021206Z"},"links":{"cited_paper":"/paper/2503.11251","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:3171ade50f15aca85b37db909336e5243351702358576bfce93283a66e6817b0","observation_id":"8b9fdd70-f981-4764-a3ae-3e19a022e48e","resolution":{"observed_at":"2026-08-07T13:52:22.021206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11473","last_updated":"2024-11-03T12:40:41Z","snapshot_observed_at":"2026-07-06T18:16:20.122022Z","submitted_at":"2024-05-19T07:48:41Z","title":"FIFO-Diffusion: Generating Infinite Videos from Text without Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11473","snapshot_observed_at":"2026-08-07T13:52:22.117866Z","title":"Fifo-diffusion: Generating infinite videos from text without training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.117866Z"},"links":{"cited_paper":"/paper/2405.11473","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:0e067a60452d5515ebc4719b692ded799a9aedd1d176725d083fa0e4caa95a1d","observation_id":"b13f9e56-6b9f-4ea2-a976-c9b6e453d8ee","resolution":{"observed_at":"2026-08-07T13:52:22.117866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T13:52:22.237972Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.237972Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:fe1c40c8e63015c62c554a1ee5e9ef8c1e841fb0d995063ca9ac3da80fedbab3","observation_id":"d12f45af-4f3b-4d6f-9679-3cce42ef9b65","resolution":{"observed_at":"2026-08-07T13:52:22.237972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16407","last_updated":"2024-03-25T03:47:53Z","snapshot_observed_at":"2026-07-06T17:49:52.751335Z","submitted_at":"2024-03-25T03:47:53Z","title":"A Survey on Long Video Generation: Challenges, Methods, and Prospects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16407","snapshot_observed_at":"2026-08-07T13:52:22.315530Z","title":"A survey on long video generation: Challenges, methods, and prospects, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.315530Z"},"links":{"cited_paper":"/paper/2403.16407","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:67c0add84098ee7354ad81c327a6ccc6b348935e526718a2497c017ff8c92ffc","observation_id":"a307adf3-e2ac-4d93-8f34-e9cdbdb6e240","resolution":{"observed_at":"2026-08-07T13:52:22.315530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-08-07T13:52:22.397770Z","title":"Unified video action model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.397770Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:377430b415522048ef64832cc70c682a1e1c170394e2548e759f2e69177d5fe5","observation_id":"c4852276-2f62-44ff-88f6-1bece02499fe","resolution":{"observed_at":"2026-08-07T13:52:22.397770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-07T13:52:22.472441Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.472441Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:d965a8a768260eb89d1f519d50753c00215ef0067a6e912f9e7d38cb139feac9","observation_id":"4ecca3c2-367f-4ce3-a333-0d009eac451e","resolution":{"observed_at":"2026-08-07T13:52:22.472441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:27.332896Z","title":"Videostudio: Generating consistent-content and multi-scene videos","venue":null,"work_id":"645760cd-3d49-4287-a673-1b24b657c2a8","year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.546815Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:3c6139ce147206f118238a4ab5b9c18f5a49bee38f477d3f540b3716c5122770","observation_id":"a076bb32-7a26-45d0-a597-80329400b0b5","resolution":{"observed_at":"2026-08-07T13:52:27.452934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-07T13:52:22.696814Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.696814Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:e270d6a0226372b5326077cff747fe07b8c156545ab6f86e71080774d3d789bc","observation_id":"e8eed2f6-a220-4570-a159-41bfa82eb6c3","resolution":{"observed_at":"2026-08-07T13:52:22.696814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:27.101673Z","title":"Mevg: Multi-event video generation with text-to-video models","venue":null,"work_id":"a637dea2-a968-41ec-9338-cce3a71b26b3","year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.790070Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:c7ead35cd2dbc13368aa56d1c563211f07f3679032deae0b5dde0a25be40f637","observation_id":"e77a915f-003e-4247-86e2-ad20030aba1a","resolution":{"observed_at":"2026-08-07T13:52:27.206936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:22.881341Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.881341Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:4eae55371fb5f8a0668b04bb20302b1906d9261cf78607b4e7e751f156028f59","observation_id":"c9b86993-63dc-4c26-ba95-210aa7a8b470","resolution":{"observed_at":"2026-08-07T13:52:22.881341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19881","last_updated":"2025-03-25T17:46:50Z","snapshot_observed_at":"2026-08-07T16:37:42.099795Z","submitted_at":"2025-03-25T17:46:50Z","title":"Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19881","snapshot_observed_at":"2026-08-07T13:52:22.951099Z","title":"Mask2dit: Dual mask-based diffusion transformer for multi-scene long video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.951099Z"},"links":{"cited_paper":"/paper/2503.19881","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:73c3a22614f18a404a785fa7932c921a23ad8a49f1422c23aab6b8b48129c5a4","observation_id":"f227f7fc-c4cc-4f16-ad55-e6e0e7674011","resolution":{"observed_at":"2026-08-07T13:52:22.951099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:26.843550Z","title":"Freenoise: Tuning-free longer video diffusion via noise rescheduling","venue":null,"work_id":"f486a23e-ffa5-4ef7-99f1-4ca92ddb66bb","year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:22.997892Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:c2e44489716a22a333cf717bddc4aac279c3f3abf834d6f88d8678ab6a1d5874","observation_id":"2cb4abcb-3de5-4d37-a93b-5e1a93019b13","resolution":{"observed_at":"2026-08-07T13:52:26.911330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08685","last_updated":"2025-05-05T03:31:30Z","snapshot_observed_at":"2026-08-07T16:06:27.835813Z","submitted_at":"2025-04-11T16:46:20Z","title":"Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08685","snapshot_observed_at":"2026-08-07T13:52:23.076920Z","title":"Seaweed-7b: Cost-effective training of video generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.076920Z"},"links":{"cited_paper":"/paper/2504.08685","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:a4c5504453ae5288a38d0e102a0b3c9848f003ae9253d7f2b450987df743f170","observation_id":"c69b16a1-53d6-411e-920f-de6d91f91e68","resolution":{"observed_at":"2026-08-07T13:52:23.076920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:26.661814Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"d3bd9cbf-5b19-41fe-807b-3f0c2e30f54f","year":2022},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.143892Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:ee1b9fad5eeab025a6cea529c87d7827f564a30617422cacab9ee8d866724ec3","observation_id":"70b1d677-ea3a-4e73-802a-d1c568ef8139","resolution":{"observed_at":"2026-08-07T13:52:26.761609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14065","last_updated":"2024-02-05T01:29:35Z","snapshot_observed_at":"2026-07-06T15:20:41.322682Z","submitted_at":"2023-04-27T09:52:35Z","title":"Lightweight, Pre-trained Transformers for Remote Sensing Timeseries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14065","snapshot_observed_at":"2026-08-07T13:52:23.239488Z","title":"Lightweight, pre-trained transformers for remote sensing timeseries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.239488Z"},"links":{"cited_paper":"/paper/2304.14065","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:da091e4857eb8eb4b24669e54304989826e077135ee0024a5816a4f23518910d","observation_id":"212a9cf1-50d9-48f8-bbad-7a0f8af8487d","resolution":{"observed_at":"2026-08-07T13:52:23.239488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:26.418829Z","title":"Mocogan: Decomposing motion and content for video generation","venue":null,"work_id":"d0ed9920-f4f8-44a2-9e03-987e5c3a9229","year":2018},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.335228Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:8313666496ec6a4cd17ea7a0eb3a243efd3aa92102a65db429bfb7952addef57","observation_id":"a1d42ff8-58c3-4633-ba3c-39b2f7a4c21f","resolution":{"observed_at":"2026-08-07T13:52:26.532001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T13:52:23.434779Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.434779Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:2b3c52f8ab4283e4e72974f912f34ae57b94d491d8445e4b4361f3875ecf482a","observation_id":"55bd74b1-3bf0-40f5-9594-e1a9d0f0218d","resolution":{"observed_at":"2026-08-07T13:52:23.434779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08350","last_updated":"2025-05-17T00:50:44Z","snapshot_observed_at":"2026-08-07T15:45:49.932043Z","submitted_at":"2025-05-13T08:48:10Z","title":"STORYANCHORS: Generating Consistent Multi-Scene Story Frames for Long-Form Narratives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08350","snapshot_observed_at":"2026-08-07T13:52:23.548609Z","title":"Storyanchors: Generating consistent multi-scene story frames for long-form narratives, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.548609Z"},"links":{"cited_paper":"/paper/2505.08350","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:c229346e94ce1f94120c0d5527b23f3ed48eeb30f9d7721addcf766695592de2","observation_id":"f999d2fb-6d40-4027-9760-581b287740b2","resolution":{"observed_at":"2026-08-07T13:52:23.548609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-07-06T15:34:51.593721Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-07T13:52:23.659573Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.659573Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:1119865162b452731040c92bec700704ae9be4378551bfc4234fd394c69781fc","observation_id":"d5bea886-b2d0-455b-af90-1c8903bcb576","resolution":{"observed_at":"2026-08-07T13:52:23.659573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-01T11:16:30.883699Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-07T13:52:23.736263Z","title":"Koala-36m: A large-scale video dataset improving con- sistency between fine-grained conditions and video content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.736263Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:58448ee4da80b615f619f268756e71c2cf61206d1f61285c61f36cec03cc3faa","observation_id":"a5e26b97-9690-40db-85af-400913c64a0e","resolution":{"observed_at":"2026-08-07T13:52:23.736263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:23.833995Z","title":"Lvbench: An extreme long video understanding benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.833995Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:31c1f8bf75635349b4bbd0197f788625d63d5196f38481a88449b1542ea03083","observation_id":"8ffd8aa8-5ad0-40cc-a4ae-1faf228dae00","resolution":{"observed_at":"2026-08-07T13:52:23.833995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10517","last_updated":"2024-03-15T17:57:52Z","snapshot_observed_at":"2026-08-06T12:50:13.936842Z","submitted_at":"2024-03-15T17:57:52Z","title":"VideoAgent: Long-form Video Understanding with Large Language Model as Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10517","snapshot_observed_at":"2026-08-07T13:52:23.917757Z","title":"Videoagent: Long-form video understanding with large language model as agent, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:23.917757Z"},"links":{"cited_paper":"/paper/2403.10517","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:3c01c047d3c1a80c05b8af9620813c72e768768bdb88cdea60b8a05fe531b469","observation_id":"7246b089-de6e-49b3-9bd5-6dd77cde997e","resolution":{"observed_at":"2026-08-07T13:52:23.917757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:26.238349Z","title":"Vatex: A large-scale, high-quality multilingual dataset for video-and-language research","venue":null,"work_id":"fcce0fd0-642d-4a91-9e94-e14813cfc352","year":2019},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.045232Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:656ed6b584786985118648de8829de57db7ef6c5e2ccfcc03ff382bbc768143e","observation_id":"0b4f6d54-734f-4648-98e3-9798e16b796c","resolution":{"observed_at":"2026-08-07T13:52:26.296919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:26.085507Z","title":"Imaginator: Condi- tional spatio-temporal gan for video generation","venue":null,"work_id":"0ae6e72b-d425-405a-9d59-1ea33a9686cf","year":2020},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.153790Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:a4fce8faa22810f9becdac04382f650349da88e778dc6c30360be6c1bbfc305d","observation_id":"83bf8499-8c7c-4f69-83f8-60277cbbbae4","resolution":{"observed_at":"2026-08-07T13:52:26.128349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:24.252204Z","title":"Advancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.252204Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:15be762d884eb25a3cb8ec801d729595859c914f4c2c4b296db5d7c01057e477","observation_id":"8e9afcf7-8ae4-48b7-97b1-71253170f820","resolution":{"observed_at":"2026-08-07T13:52:24.252204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01316","last_updated":"2025-03-29T08:56:56Z","snapshot_observed_at":"2026-07-06T20:00:05.118831Z","submitted_at":"2024-12-02T09:32:36Z","title":"Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01316","snapshot_observed_at":"2026-08-07T13:52:24.370109Z","title":"Long video diffusion generation with segmented cross-attention and content-rich video data curation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.370109Z"},"links":{"cited_paper":"/paper/2412.01316","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:cb76f6eb56e375bb83655a63756fde1dc6cb8b93adfebb8105e98765099403d6","observation_id":"40835e76-76e2-4297-bbc0-8aeaf401f988","resolution":{"observed_at":"2026-08-07T13:52:24.370109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T13:52:24.467700Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.467700Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:85791b3a043d3dbe414c8cd41f75931a71fb34355c8b04dd169ab58e4cd8559a","observation_id":"1861851a-92b6-47e7-94ad-99d54fc6287e","resolution":{"observed_at":"2026-08-07T13:52:24.467700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:25.898637Z","title":"Merlot: Multimodal neural script knowledge models","venue":null,"work_id":"2a124b39-e283-48f1-ad99-156383d83378","year":2021},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.570316Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:40e405bc9d625897afd6d09eae32175f009fcfbeb0c61661e734a53bb356b806","observation_id":"f68c7dbf-cef9-4122-9acc-69273d4938b4","resolution":{"observed_at":"2026-08-07T13:52:25.994105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:24.643654Z","title":"Moviedreamer: Hierarchical generation for coherent long visual sequence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.643654Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:b30f490ed5a32ca436df3baa81a90ea4a403d4681fffc95f06257cd61c366142","observation_id":"4cd00ff3-e07a-4ac9-b454-5e03a94706d1","resolution":{"observed_at":"2026-08-07T13:52:24.643654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-07T13:52:24.723287Z","title":"Vbench-2.0: Advancing video generation bench- mark suite for intrinsic faithfulness, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.723287Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:63acbed5ec39207f9cb5bc0a7fc035b52f4282fae175ca913b27283ed2ba8c80","observation_id":"bfaca529-075e-4c00-81e6-caaaf624d3f9","resolution":{"observed_at":"2026-08-07T13:52:24.723287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:24.804117Z","title":"Videogen-of-thought: A collaborative framework for multi-shot video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.804117Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:b48c7eab9541ad579e8710c37fddcd43710cba5e452a3d99fd2b90e877d24689","observation_id":"1a69e4fa-55ef-4a37-bc3e-75fd0c59ff2a","resolution":{"observed_at":"2026-08-07T13:52:24.804117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:25.666657Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"64503f3d-a80e-4c5b-ac4c-da325302509c","year":2018},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.885503Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:b95460eef3e7d81ba78c367aabf8e32c726c6b0c1e6741bb0851a94c7244cac2","observation_id":"63da9f05-e6a4-45aa-a677-27469349e31c","resolution":{"observed_at":"2026-08-07T13:52:25.793585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:25.505530Z","title":"Storydiffusion: Consistent self-attention for long-range image and video generation","venue":null,"work_id":"e2b261d4-50d0-48de-b224-b202960c78e2","year":2024},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.986017Z"},"links":{"citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:dcbb4bf525eb4ba9f5c74cfbd71a5e28c7966d5665371851ea583964aeb6fe9e","observation_id":"614f1169-0a76-4a97-82d3-70953de36695","resolution":{"observed_at":"2026-08-07T13:52:25.576965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:44:13.870752Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2505.20827."}