MICViT outperforms CNN and transformer baselines on brain age prediction from multimodal 3D MRI by combining modality-specific and cross-modal local/global attention across three heterogeneous datasets.
Mimetic initialization of self-attention layers
2 Pith papers cite this work. Polarity classification is still indexing.
2
Pith papers citing it
fields
cs.CV 2verdicts
UNVERDICTED 2representative citing papers
DCT-based initialization and frequency truncation for self-attention improve accuracy and reduce overhead in Vision Transformers on standard benchmarks.
citing papers explorer
-
Modeling Local, Global, and Cross-Modal Context in Multimodal 3D MRI
MICViT outperforms CNN and transformer baselines on brain age prediction from multimodal 3D MRI by combining modality-specific and cross-modal local/global attention across three heterogeneous datasets.
-
Discrete Cosine Transform Based Decorrelated Attention for Vision Transformers
DCT-based initialization and frequency truncation for self-attention improve accuracy and reduce overhead in Vision Transformers on standard benchmarks.