A compact spatio-temporal network mixing convolutions and linear-complexity temporal attention reaches strong accuracy on UCF101, HMDB51, and Kinetics400 with a 7M-parameter model and float16 training.
NeurIPS32(2019)
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
CA3D: Convolutional-Attentional 3D Nets for Efficient Video Activity Recognition on the Edge
A compact spatio-temporal network mixing convolutions and linear-complexity temporal attention reaches strong accuracy on UCF101, HMDB51, and Kinetics400 with a 7M-parameter model and float16 training.