DynaFLIP pre-trains dynamics-aware image encoders by aligning image, language, and 3D flow modalities through simplex-volume minimization plus regularizers on video triplets, yielding reusable backbones that improve manipulation policies by up to 22.5% in out-of-distribution settings.
Towards uniformity and alignment for multimodal representation learning.arXiv preprint arXiv:2602.09507
2 Pith papers cite this work. Polarity classification is still indexing.
years
2026 2representative citing papers
Adding a dispersion loss plus a bounded cross-modal drift penalty to intermediate embeddings improves unimodal and multimodal accuracy across audio-visual, image-text, and RF benchmarks.
citing papers explorer
-
DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation
DynaFLIP pre-trains dynamics-aware image encoders by aligning image, language, and 3D flow modalities through simplex-volume minimization plus regularizers on video triplets, yielding reusable backbones that improve manipulation policies by up to 22.5% in out-of-distribution settings.
-
Diverse via bounded Agreement: Geometric Regularization for Multimodal Fusion
Adding a dispersion loss plus a bounded cross-modal drift penalty to intermediate embeddings improves unimodal and multimodal accuracy across audio-visual, image-text, and RF benchmarks.