A 1D token interface with Selective Token Editing improves multimodal image fusion by modeling global appearance factors separately from local 2D structures, yielding best overall performance on four benchmarks.
From text to pix- els: A context-aware semantic synergy solution for infrared and visible image fusion.arXiv preprint arXiv:2401.00421
5 Pith papers cite this work, alongside 4 external citations. Polarity classification is still indexing.
citation-role summary
citation-polarity summary
fields
cs.CV 5years
2026 5verdicts
UNVERDICTED 5roles
background 1polarities
background 1representative citing papers
DRFusion uses Stabilized History Guidance, Soft Temporal Anchoring, and Decoupled Structure-Motion Adaptation to achieve drift-resilient temporal consistency in infrared-visible video fusion.
EAPFusion uses self-evolving intrinsic priors to produce dynamic, scene-adaptive convolution kernels and channel-mixing fusion for infrared-visible images, reporting state-of-the-art results and downstream gains.
SFRF combines uncertainty-aware multi-scale registration with frequency-domain thermal consistency and dual-branch fusion to handle unregistered infrared-visible image pairs.
CLDyN establishes a closed-loop semantic transmission chain with a Requirement-driven Semantic Compensation module to make infrared-visible fusion adapt to diverse downstream tasks.
citing papers explorer
-
From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image Fusion
A 1D token interface with Selective Token Editing improves multimodal image fusion by modeling global appearance factors separately from local 2D structures, yielding best overall performance on four benchmarks.
-
DRFusion: Drift-Resilient Temporally Consistent Infrared-Visible Video Fusion
DRFusion uses Stabilized History Guidance, Soft Temporal Anchoring, and Decoupled Structure-Motion Adaptation to achieve drift-resilient temporal consistency in infrared-visible video fusion.
-
EAPFusion: Intrinsic Evolving Auxiliary Prior Guidance for Infrared and Visible Image Fusion
EAPFusion uses self-evolving intrinsic priors to produce dynamic, scene-adaptive convolution kernels and channel-mixing fusion for infrared-visible images, reporting state-of-the-art results and downstream gains.
-
Uncertainty-aware Spatial-Frequency Registration and Fusion for Infrared and Visible Images
SFRF combines uncertainty-aware multi-scale registration with frequency-domain thermal consistency and dual-branch fusion to handle unregistered infrared-visible image pairs.
-
Customized Fusion: A Closed-Loop Dynamic Network for Adaptive Multi-Task-Aware Infrared-Visible Image Fusion
CLDyN establishes a closed-loop semantic transmission chain with a Requirement-driven Semantic Compensation module to make infrared-visible fusion adapt to diverse downstream tasks.