UniForm trains one diffusion transformer on a shared audio-video latent space to handle video-to-audio, audio-to-video, and text-to-audio-video generation with competitive results.
Scaling instruction-finetuned language models,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.MM 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
background 1representative citing papers
citing papers explorer
-
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
UniForm trains one diffusion transformer on a shared audio-video latent space to handle video-to-audio, audio-to-video, and text-to-audio-video generation with competitive results.