A frozen token-importance scorer trained with an FSQ-MagViT tokenizer enables 128-frame masked-autoencoder pre-training, which outperforms 32-frame pre-training and sets state-of-the-art results on Diving48 and EPIC-Kitchens-100 verbs.
Video recap: Recursive captioning of hour-long videos
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2024 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Extending Video Masked Autoencoders to 128 frames
A frozen token-importance scorer trained with an FSQ-MagViT tokenizer enables 128-frame masked-autoencoder pre-training, which outperforms 32-frame pre-training and sets state-of-the-art results on Diving48 and EPIC-Kitchens-100 verbs.