Generative video models exhibit emergent zero-shot capabilities across perception, manipulation, and basic reasoning tasks.
Title resolution pending
3 Pith papers cite this work, alongside 12 external citations. Polarity classification is still indexing.
3
Pith papers citing it
12
external citations · external index
citation-role summary
background 1
citation-polarity summary
roles
background 1polarities
background 1representative citing papers
DragNUWA integrates text, image, and trajectory controls into a diffusion video model using a Trajectory Sampler, Multiscale Fusion, and Adaptive Training to enable fine-grained open-domain video generation.
citing papers explorer
-
Video models are zero-shot learners and reasoners
Generative video models exhibit emergent zero-shot capabilities across perception, manipulation, and basic reasoning tasks.