← back to paper
arxiv: 2602.02533 · 2 revisions
HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models