{"as_of":"2026-08-07T16:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba5c955a7f714adfd20afbad4e6d0b75a107482b7eb50d690a32c63934dc8aa4","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:24:07.779000Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.13753/citation-record","integrity":"/paper/2507.13753/integrity","json":"/paper/2507.13753/citation-record.json","paper":"/paper/2507.13753"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.320630Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"83999c33-d588-46e2-b4ec-98f396c3b678","year":2021},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:03.661367Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:ffe8b2d05b1709071f8e7e53af650f4a66f628bd7c7471da82ec4e7ef913e5c8","observation_id":"d0aa1032-d329-4d63-8247-9bb45a30bd19","resolution":{"observed_at":"2026-08-06T16:24:11.327857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.304308Z","title":"Huang, and Niloy J","venue":null,"work_id":"b4fd2914-fc67-42ca-aec8-15fce4b51b5b","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:03.740191Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:5367dd4d764a197e59fa0ebac3be77c226a17a4b5bfd07a9c4e319be38942a2e","observation_id":"fea59f5e-5851-4875-abd1-90ec627f9a3e","resolution":{"observed_at":"2026-08-06T16:24:11.308915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.287919Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"d021ceb4-4a6e-4d63-8507-e0f22eada42b","year":null},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:03.826011Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:7fbbcbef4ec159fa46fd448be22d946aef6cdc3f4c854f8e796508e4c458a530","observation_id":"3dfc697b-0294-40d4-abc9-6684c7e55d45","resolution":{"observed_at":"2026-08-06T16:24:11.293233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.272115Z","title":"Style in- jection in diffusion: A training-free approach for adapting large-scale diffusion models for style transfer","venue":null,"work_id":"4ef6fe0e-b1fd-4708-b6db-65b7e8179194","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:03.932309Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:a95ec365e7b475531b7805d4c3fafd204383c577bdbac1ff1b93bbc84e1e1020","observation_id":"0e1bcdd9-2d98-40f4-874d-dbd2d406b9e6","resolution":{"observed_at":"2026-08-06T16:24:11.276753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.256085Z","title":"Diffsynth: La- tent in-iteration deflickering for realistic video synthesis","venue":null,"work_id":"0fbec89c-50cd-4b99-a3bd-5a4c19936d18","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.026929Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:4adb429078f58fff8857bf679e9dc242f7dae71624e77613e5e419c686dd458b","observation_id":"a87cc984-5599-44c9-9934-d66f5bb13213","resolution":{"observed_at":"2026-08-06T16:24:11.261382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08453","last_updated":"2025-01-14T21:53:11Z","snapshot_observed_at":"2026-07-06T20:21:09.148018Z","submitted_at":"2025-01-14T21:53:11Z","title":"Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08453","snapshot_observed_at":"2026-08-06T16:24:04.099250Z","title":"Vchitect-2.0: Parallel trans- former for scaling up video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.099250Z"},"links":{"cited_paper":"/paper/2501.08453","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:3e00a6e5993541a082bf9f9fe6f5dc32b8c7866ffb47361aac37dc1dad6a1ed0","observation_id":"5741b480-aabe-4f75-800f-eb9fc30f5b5d","resolution":{"observed_at":"2026-08-06T16:24:04.099250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-06T08:12:35.134201Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-06T16:24:04.195327Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.195327Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:bfbd91618d403dea3eb1150803fe9386c15c8ff2916f4778f3f19de3ce60f666","observation_id":"9072bd9c-9ee6-4a21-9ce7-a2fabb2afd5d","resolution":{"observed_at":"2026-08-06T16:24:04.195327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-06T16:24:04.284760Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.284760Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:bd6c2a44b6a3fd5c564a37c7a0f8a928f8c1224a55ffbf942cc176871f1d9f4b","observation_id":"198ec7a1-a731-4f2f-b311-514e79b0cb7a","resolution":{"observed_at":"2026-08-06T16:24:04.284760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T16:24:04.387504Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.387504Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:e8a6901c87bfde4e4a47955f09c6a5e4be202f7de2331ec4ddefd799cb0ca7b9","observation_id":"e8be94f5-25dc-4c24-b133-79ac6cb494f2","resolution":{"observed_at":"2026-08-06T16:24:04.387504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:04.473396Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.473396Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:ca9cd6302e4e3d48d376e6d93c325074d463f1b0ddbf55b3fefbce80a419e305","observation_id":"4c6848b5-8a91-4dd0-b625-b2ed812a968b","resolution":{"observed_at":"2026-08-06T16:24:04.473396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14073","last_updated":"2023-08-03T09:34:24Z","snapshot_observed_at":"2026-07-06T15:58:43.241452Z","submitted_at":"2023-07-26T09:50:44Z","title":"VideoControlNet: A Motion-Guided Video-to-Video Translation Framework by Using Diffusion Model with ControlNet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14073","snapshot_observed_at":"2026-08-06T16:24:04.571398Z","title":"Videocontrolnet: A motion-guided video-to-video translation framework by using diffusion model with controlnet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.571398Z"},"links":{"cited_paper":"/paper/2307.14073","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:ca2fa707c0ee89eeaaccc495bbb0c0b9e5462b246676dc279bc958e977b97576","observation_id":"392234db-f6f1-463e-9773-724403ced627","resolution":{"observed_at":"2026-08-06T16:24:04.571398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.066846Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"22e65fb7-d5d2-4e50-9e73-bbf72f3e027a","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.658315Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:6669f62e3bdea48729f2c391019fa0d155c3427f751b546e82a2f3ca8a6ee682","observation_id":"2dc5c1f7-20e0-4835-b18d-5dbda1226131","resolution":{"observed_at":"2026-08-06T16:24:11.073040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.050229Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":"eab1a5fe-243f-44bd-addb-db9fab6b57d4","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.779140Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:8b380995a0caae2e7ddce01edfd9970db3721ace438da09327a574416a0bdd80","observation_id":"9bd42f93-9578-4d15-8139-3352f5e9e531","resolution":{"observed_at":"2026-08-06T16:24:11.055169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T16:24:04.867561Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.867561Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:c4b2d34d9946e46cd7b92639e8ea47ae0097b72f326646e38a34041ac2da8ea0","observation_id":"df7d391b-9067-43e4-85d2-c0e13ece3784","resolution":{"observed_at":"2026-08-06T16:24:04.867561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-07-06T17:48:24.076444Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-08-06T16:24:04.956206Z","title":"Anyv2v: A plug-and-play framework for any video- to-video editing tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.956206Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:087102ab93b9b948d4c6dd4cf9c71b71e2dac1e90c1ce928b4c3d78263e88622","observation_id":"a9ef22ac-c314-4987-9511-ed90bea7f57e","resolution":{"observed_at":"2026-08-06T16:24:04.956206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.019992Z","title":"Amt: All-pairs multi-field transforms for efficient frame interpolation","venue":null,"work_id":"51502c35-dcdb-4e4c-9358-fd17375c8eb3","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.075194Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:76daa12e481d618076b8148bfa5ee87fec484e6c3d76f10a82c1e8d3db1b2d0c","observation_id":"29fcdf9c-5ae6-4433-913d-484fa50812f1","resolution":{"observed_at":"2026-08-06T16:24:11.030716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.997093Z","title":"Flowvid: Taming imperfect op- tical flows for consistent video-to-video synthesis","venue":null,"work_id":"17e02374-c91d-401a-9833-2b1ad6fcafb2","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.139965Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:33c41933a61213efd293c9e596ab58f28532e0d464170fd5447d39b01fd64310","observation_id":"6ba76e2c-012c-4315-96b6-8d829a3a266e","resolution":{"observed_at":"2026-08-06T16:24:11.001903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-06T16:24:05.217568Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.217568Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:753b9559cbad9f28f210429db9e83d62a41e86b9134f2d9e290f9593436d6131","observation_id":"36f84924-0470-431f-8eb2-8773afda9bb5","resolution":{"observed_at":"2026-08-06T16:24:05.217568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12706","last_updated":"2024-03-19T13:08:54Z","snapshot_observed_at":"2026-07-06T17:46:58.758589Z","submitted_at":"2024-03-19T13:08:54Z","title":"AnimateDiff-Lightning: Cross-Model Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12706","snapshot_observed_at":"2026-08-06T16:24:05.312282Z","title":"Animatediff-lightning: Cross-model diffusion distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.312282Z"},"links":{"cited_paper":"/paper/2403.12706","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:91f404b6f93c9f04cbff236b3d41f517edeb347640cef61d1717078f5a57f4fd","observation_id":"8fa1c850-ab78-40ae-a79a-833be2520ff8","resolution":{"observed_at":"2026-08-06T16:24:05.312282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.976366Z","title":"Towards understanding cross and self-attention in stable diffusion for text-guided image editing","venue":null,"work_id":"700c3d31-2941-482e-998d-6f686d6f60e7","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.379869Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:1d5ab5a8835f04efb7d03b0e89f00c22d3de961d050ce128864cef54576c6872","observation_id":"c554a101-d293-4e2f-bd43-d2de26e0588c","resolution":{"observed_at":"2026-08-06T16:24:10.982327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.951832Z","title":"At- tentive linguistic tracking in diffusion models for training- free text-guided image editing","venue":null,"work_id":"63f7f57d-aedf-463f-8ab0-275f4181d15b","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.466037Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:79ab6ff5d439b8b7f29aef21ea8a96949fd1bd987d07d26cd9001a1decd4262f","observation_id":"f9958775-c95f-4fb9-9431-f61f11ac0c70","resolution":{"observed_at":"2026-08-06T16:24:10.956632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.933469Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":"1d892a0d-87bf-41e4-8716-d4157c6c0049","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.555043Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:47cdc9e0d7db823edcb354c674e1b9e456b615fe119d9f8650ae5a715fb4135d","observation_id":"e0d2149e-da78-48e9-9e14-de0bfcdc9884","resolution":{"observed_at":"2026-08-06T16:24:10.939679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.914971Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":"873237b5-1469-4c04-bc92-eff62dcd3a31","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.625822Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:b826d5259522da28a596dfd5b13468842cb0c59108e4bef44fd5ddb247af536f","observation_id":"918aafef-6849-436e-92b0-5db97238a645","resolution":{"observed_at":"2026-08-06T16:24:10.920453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-07-06T11:34:54.333802Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-06T16:24:05.715742Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.715742Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:92adc4989c44421bc5ad86c19c681cbef58275abdf6a59d95c537ebadf3fb35f","observation_id":"a4c8f94e-c403-4eb8-8480-bbe6e462190b","resolution":{"observed_at":"2026-08-06T16:24:05.715742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.768006Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":"e4e0dde0-c771-4fc6-af99-b52df9724395","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.801114Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:90f6325bcb479d1629219159710942b6cae29c81b3a01c7db0b10fa6df44c2a2","observation_id":"d72f10aa-8b15-455e-8fe0-e02e0c29693b","resolution":{"observed_at":"2026-08-06T16:24:10.897595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.07460","last_updated":"2022-05-16T06:03:00Z","snapshot_observed_at":"2026-08-04T18:06:26.992880Z","submitted_at":"2022-05-16T06:03:00Z","title":"Diffusion Models for Adversarial Purification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.07460","snapshot_observed_at":"2026-08-06T16:24:05.886229Z","title":"Diffusion models for adversarial purification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.886229Z"},"links":{"cited_paper":"/paper/2205.07460","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:5fec26e1f1bf82a1b075349dbd52501517733ede82d3e1abded476c94f70d6d1","observation_id":"6d940d20-b81a-42e8-97de-901cd1f70086","resolution":{"observed_at":"2026-08-06T16:24:05.886229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.535203Z","title":null,"venue":null,"work_id":"64437164-2c0a-45a6-b99b-1ef5d374fcb5","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.967881Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:02b00ceb061c93eefb2295ed120ab204200fea984ed195344cf037a72a81a89a","observation_id":"6473f36f-99c7-45fe-bfb0-107d9b29ee7f","resolution":{"observed_at":"2026-08-06T16:24:10.647955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.328810Z","title":"Pika 1.0","venue":null,"work_id":"cfb118ea-069e-4889-a44c-122155988cd5","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.036782Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:7d18b9b1ea05ec1d348585ede2c4a6edb5e1056a87534a6d458eec674b8cbe59","observation_id":"15b108a6-e171-4e04-8766-8e853205d8b4","resolution":{"observed_at":"2026-08-06T16:24:10.396746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T16:24:06.099876Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.099876Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:897ed5831b30055f27d89d6c1c1a8f57d5e1ac39a4df3369d201f9c689a4c2f8","observation_id":"f3e0ee66-6b11-45e7-99fe-3ba01e1f947e","resolution":{"observed_at":"2026-08-06T16:24:06.099876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.216647Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":"e47404c1-d049-4078-90c5-8dc79434fa4f","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.189085Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:86510235dcfc9047d954fa32ac1f16e9854fc9ee7426eb256c66f92eecc387a5","observation_id":"375ff990-6126-4afb-a6eb-1ae9bb0c884b","resolution":{"observed_at":"2026-08-06T16:24:10.276468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:09.983621Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"97fda0f7-d1ad-4f12-b805-aedabb76e80d","year":2022},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.293597Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:62c2cf3cbf03d87846b89bda718f53c706024d8391d3020e621aab5b1800bfa4","observation_id":"76492959-6da0-4ef4-9a55-911f3565b125","resolution":{"observed_at":"2026-08-06T16:24:10.087093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:09.729811Z","title":null,"venue":null,"work_id":"69011e47-4728-4e69-aea5-747b4e8853e5","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.383786Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:dee441bf00ef06470bc61ee2161198e48b6c00d5a5bb2954a7c33161285698aa","observation_id":"907c4bd1-90d0-4049-b627-4946d099121e","resolution":{"observed_at":"2026-08-06T16:24:09.833297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:09.696661Z","title":null,"venue":null,"work_id":"11b26e8c-0e02-4788-99b6-503762e25156","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.484434Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:927e8d35ec7b2c922d5db36ae442be7d4664de7a55344a2b1ddf31a28e48d1db","observation_id":"a3af56a6-1e74-46b2-95c1-85849e106bab","resolution":{"observed_at":"2026-08-06T16:24:09.717542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:09.516635Z","title":"Bivdiff: A training-free framework for general-purpose video synthesis via bridging image and video diffusion models","venue":null,"work_id":"66f90529-2b95-4c27-bca7-3554af7161ae","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.570787Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:669ada40c63e74173b356baaa92da18a0a9551121b2499058ced0efdc3bd8b73","observation_id":"320ef7f0-0c21-4df9-940f-9781f83cfd51","resolution":{"observed_at":"2026-08-06T16:24:09.612955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:09.344703Z","title":"Edit-a-video: Single video editing with object-aware consistency","venue":null,"work_id":"acc3560b-52fa-48a0-b8c2-94abb58469c4","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.666069Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:ffcb6448dee21fca0be82f163f320b18a2f434826968d95dc4c5a7c2ca0478f8","observation_id":"aab08ec3-8f12-4e8a-9e98-8016e78cb9fa","resolution":{"observed_at":"2026-08-06T16:24:09.422686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-06T16:24:06.746047Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.746047Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:97c35ba947a34b94b569ed393b42ff888986a2ee0f38cb3d2ad90fbc367a6687","observation_id":"b4988830-1ec9-464e-b471-d6a70db25a75","resolution":{"observed_at":"2026-08-06T16:24:06.746047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T16:24:06.829645Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.829645Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:a66082b665f72f0ce06cd3a03519fd0aab903f7a93e1dcf62ef586a71afeb9f5","observation_id":"328a147e-05c2-41d5-81eb-ab35e98dfc4f","resolution":{"observed_at":"2026-08-06T16:24:06.829645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:09.133507Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"42cf5193-f9c7-4c92-88bc-368846f8df19","year":1921},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.915722Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:e59c9debaf0a4995823483c1eb5476be376ead7589b05268f61453acb69da0aa","observation_id":"8657e463-d5c8-4a85-913c-bcf6d3112a97","resolution":{"observed_at":"2026-08-06T16:24:09.249295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-07-06T16:05:35.645037Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-06T16:24:06.980555Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.980555Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:8872f4d9e503ab9085ff8377ce06b05fdb81f122b8952a352d4f2a548a1bf2e9","observation_id":"845dbd66-6d58-4869-8af5-3aa2b0ed9879","resolution":{"observed_at":"2026-08-06T16:24:06.980555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-06T16:24:07.087178Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.087178Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:ed60c09664803cba1c6abfb03673f4f37dc93aa237e3238cba2ecc3c94527668","observation_id":"f6e5d777-157d-4421-9480-31be1a41639a","resolution":{"observed_at":"2026-08-06T16:24:07.087178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:08.960746Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"299358f2-4cdf-4d94-ac53-5b476a39f90f","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.174284Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:d9eb0b7932c15460a8acc7b38dff8005469bfb82c7415eb822ccb74147530820","observation_id":"a9a1aa62-1b7b-41d2-9abd-0de5e46b7720","resolution":{"observed_at":"2026-08-06T16:24:09.038369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:08.750900Z","title":"Tune-a-video: One-shot tun- ing of image diffusion models for text-to-video generation","venue":null,"work_id":"b6712cff-dfb2-4dc7-b5ba-2e79950c41a8","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.254277Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:68c5cb2acb095be456d595c622e5706b36837ea042fed4fa9baf54a573542752","observation_id":"7cf0cde8-aba3-4dc7-b04d-146c968e51e1","resolution":{"observed_at":"2026-08-06T16:24:08.865062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:08.607855Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":"1dc9df0a-be89-4967-a944-5d2532592266","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.339187Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:5bc799fa69d945ce33289470d487aeb867ca838c70e641824bed80297f3c9fe7","observation_id":"ffa0efa5-6e01-4291-81c3-745e8b7e73d2","resolution":{"observed_at":"2026-08-06T16:24:08.669898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:08.469874Z","title":"Fresco: Spatial-temporal correspondence for zero-shot video translation","venue":null,"work_id":"df695f61-11a0-4bfc-a88b-c78266935048","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.427186Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:5a7162475d2f01d30b44504a3d044dac1c3cea745eddf7dd160f249668778fbd","observation_id":"a13928cf-a1bb-4530-9664-af5f101d3778","resolution":{"observed_at":"2026-08-06T16:24:08.509404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T16:24:07.516251Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.516251Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:18b76f0ddfded0c5c7a1bc77f704633b894daf60fc38d1b14429fb315ccb856b","observation_id":"60f5666e-ec18-497c-99ac-9f1789767b36","resolution":{"observed_at":"2026-08-06T16:24:07.516251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-06T16:24:07.602629Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.602629Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:6a72aba75de61af276a790a176a7712b2f6bcdada0f7b7d259dca039df4aea8c","observation_id":"97fe92c6-dd19-48d1-8024-14ca4544c834","resolution":{"observed_at":"2026-08-06T16:24:07.602629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13077","last_updated":"2023-05-22T14:48:53Z","snapshot_observed_at":"2026-08-07T10:11:05.104768Z","submitted_at":"2023-05-22T14:48:53Z","title":"ControlVideo: Training-free Controllable Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13077","snapshot_observed_at":"2026-08-06T16:24:07.699049Z","title":"Controlvideo: Training-free controllable text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.699049Z"},"links":{"cited_paper":"/paper/2305.13077","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:29dd32afa8a73f10d532432fc3be8bb54d6418d7553851218ddf8fc2b892f0a5","observation_id":"6f4480d7-b3f2-4914-bd8d-0eb6e57c9371","resolution":{"observed_at":"2026-08-06T16:24:07.699049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05438","last_updated":"2024-03-08T16:44:54Z","snapshot_observed_at":"2026-07-06T17:41:38.868865Z","submitted_at":"2024-03-08T16:44:54Z","title":"VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2403.05438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05438","snapshot_observed_at":"2026-08-06T16:24:07.948797Z","title":"VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"fa1ff2f0-ef24-4b08-8292-7ca89186c202","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.779000Z"},"links":{"cited_paper":"/paper/2403.05438","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:53d05da5b5691775e731058ed5449ac2310734e9017865696805754089de4122","observation_id":"ec343ff1-a59f-4dbf-ac32-4a867b6a9583","resolution":{"observed_at":"2026-08-06T16:24:08.016744Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:14:38.953158Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2507.13753."}