SweetTok compresses 17-frame 256x256 videos into 1,280 tokens via decoupled spatial-temporal query autoencoding and a parts-of-speech language codebook, reporting an rFVD of 20.46 on UCF-101 versus 35.15 for LARP.
Bert: Pre-training of deep bidirectional trans- formers for language understanding
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.CV 1years
2024 1verdicts
CONDITIONAL 1roles
background 1polarities
unclear 1representative citing papers
citing papers explorer
-
SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization
SweetTok compresses 17-frame 256x256 videos into 1,280 tokens via decoupled spatial-temporal query autoencoding and a parts-of-speech language codebook, reporting an rFVD of 20.46 on UCF-101 versus 35.15 for LARP.