MTID improves action sequence planning in instructional videos by adding a learnable latent interpolation module, a masked projection, and a task-adaptive proximity loss to a DDIM-based diffusion model.
Diffusion models in vision: A survey
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos
MTID improves action sequence planning in instructional videos by adding a learnable latent interpolation module, a masked projection, and a task-adaptive proximity loss to a DDIM-based diffusion model.