
江南大学 ICML 2026训练用文本、推理不用文本TEDFusion 进入双曲空间用一句话来概括并引出全文TEDFusion在训练阶段借助文本学习场景相关的融合策略并通过双曲空间建模图像与语义的层次关系推理时仅需输入红外与可见光图像。01 论文信息Text-Driven Fusion for Infrared and Visible Images: Achieving Image Scene Adaptation on Hyperbolic Space | 文本驱动的红外与可见光图像融合在双曲空间中实现场景自适应作者Huan Kang, Hui Li, Tianyang Xu, Tao Zhou, Xiao-Jun Wu通讯作者, Josef Kittler单位江南大学人工智能与计算机学院英国萨里大学视觉、语音与信号处理中心代码https://github.com/Shaoyun2023/TEDFusion下载https://arxiv.org/abs/2606.15104v102 摘要传统的红外和可见光融合一般是在欧氏空间里进行跨模态特征处理很难很好地表示出从场景语义到局部纹理之间的层级关系。已经有的文本引导的方法还需要在推理过程中不断地给出文本信息从而提高了实际使用的成本。作者提出了TEDFusion在训练过程中用BLIP来生成图像描述并且利用文本语义去控制亮度、饱和度、对比度以及纹理等属性的融合并且把图像和文本特征都映射到了双曲空间中做层级对齐。推理阶段不需要文本信息模型可以根据输入的图片自己调节融合方式。03 创新点文本监督和无文本推理在训练过程中使用文本在推理阶段只提供红外和可见光图像作为输入从而降低了对文本驱动融合的需求。属性- 文本门控融合模块(ATGFM)把亮度、饱和度、纹理复杂度和对比度等属性以及文本语义一起进行建模。双曲语义对齐Text-Image Association Module(TIAM) 在庞加莱球上建立了图文之间的层级关系在一定程度上解决了欧式空间里出现的语义平面化的问题。04 方法TEDFusion 输入已经对齐好的红外和可见光图像视觉编码器先提取出多尺度特征。在训练过程中BLIP会生成两种不同类型的图像描述。ATGFM提取出饱和度、亮度、纹理复杂度以及对比度等信息之后利用门控权重把属性和文本特征进行融合。在训练过程中用到30%的概率来随机地丢掉文本嵌入从而使模型慢慢学会只靠视觉属性来进行语义引导。然后把图像与文本特征映射到庞加莱球上并用文本做为语义锚点利用莫比乌斯平移来组织四种尺度上的视觉特征。经过加强之后的特征被重新映射到欧式空间中并且通过嵌套式的解码器产生出融合后的图像。训练损失包括强度损失、梯度损失、SSIM损失以及双曲损失等部分其中各个部分分别对应于显著性信息、纹理边沿、结构一致性与跨模态语义对齐等方面的要求。05 实验实验设置用TNO、RoadScene、MSRS和LLVIP四个数据集进行融合实验并且和DenseFuse、U2Fusion、TextFusion、Text-IF、GIFNet等十一种方法做对比在EN、SD、SF、AG以及SCD上得到的结果。实验结果在四个数据集的20个指标里TEDFusion获得了13个第一和5个第二。在M3FD目标检测上它的YOLOv7评估结果为57.37%mAP0.5在MSRS语义分割上它的DeepLabV3评估结果为69.64%mIoU。消融实验去掉文本监督、ATGFM、双曲关联或者双曲损失之后各项指标都变差了。从曲率实验的结果来看在(c1.0)的情况下比在(c0.5)和(c0.7)的时候要好一些所以可以得出结论说双曲线空间中的分层结构对于融合结果是有好处的。06 总结TEDFusion采用的是“文本训练视觉推理”的模式来学习场景自适应融合策略并且没有增加推理输入的情况下完成了这个过程并且用到了双曲线空间去表示图像和文本之间存在的层级关系。实验证明了这种方法在各种不同的数据集中以及目标检测、语义分割等任务上都具有很好的稳定性。文本部分教给模型如何理解上下文而双曲空间则用来存储语义层级。往期推荐