A motion-weighted training loss (MotiF) improves text alignment and object motion in text-image-to-video generation, winning 72% of human-preference comparisons against nine baselines on a new benchmark.
Videocrafter2: Overcoming data limitations for high-quality video diffusion models, 2024
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
method 1
citation-polarity summary
fields
cs.CV 1years
2024 1verdicts
CONDITIONAL 1roles
method 1polarities
use method 1representative citing papers
citing papers explorer
-
MotiF: Making Text Count in Image Animation with Motion Focal Loss
A motion-weighted training loss (MotiF) improves text alignment and object motion in text-image-to-video generation, winning 72% of human-preference comparisons against nine baselines on a new benchmark.