DyST-XL improves compositional text-to-video generation by adding LLM-planned dynamic layouts, masked attention for attribute binding, and first-frame feature reuse for identity, all without retraining.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation
DyST-XL improves compositional text-to-video generation by adding LLM-planned dynamic layouts, masked attention for attribute binding, and first-frame feature reuse for identity, all without retraining.