
CVPR 2026 · 图像融合同一张照片上有的地方曝光过度有的地方曝光不足。目前的红外和可见光融合的方法一般都是一刀切的方式对待整个图像而没有考虑到各个区域之间存在的差别。RegionFuse让网络学会看区域下菜给每一个局部都配上了不同的融合策略。01 论文基础信息 BASIC INFORMATION英文题目RegionFuse: Region-Adaptive Pixel Distribution Learning for Infrared and Visible Image Fusion中文题目RegionFuse面向红外与可见光图像融合的区域自适应像素分布学习作者Jianghan Xia, Hong Song*, Jinfu Li*, Yucong Lin, Shihan Ma, Jingfan Fan, Danni Ai, Tianyu Fu, Deqiang Xiao, Jian Yang**通讯作者单位北京理工大学 Beijing Institute of Technology发表CVPR 2026代码https://github.com/DarkIceField/RegionFuse02 摘要与全文预览 ABSTRACT一句话读懂把“整个图片都一起融合”升级为“根据区域来定制融合”即网络会针对图像中的各个部分的明暗情况动态地决定应该多用红外还是多用可见光。红外和可见光图像融合IVIF的目的就是把两种成像方式互补的信息整合到一张图上红外提供热辐射信息而可见光则提供纹理细节。目前的方法大都采用固定或者全局分布的融合权重没有考虑到图像内部各个部分像素分布的不同因此效果不是很好。因此作者提出了 RegionFuse用局部像素分布来动态生成融合权重形成“区域自适应”的融合方式。主要就是区域注意力混合机制 MoRA将各个区域分配给不同的“专家”进行单独处理并且使用区域特征压缩模块 RFCM 来加强有用的区域、抑制冗余的区域。大量的实验表明该方法具有很好的效果和较强的鲁棒性在处理明暗不均的情况中尤为明显。图 1 三种融合方式比较固定、样本自适应、区域自适应03 方法 · 区域怎样“看菜下饭” METHOD整体框架RegionFuse 由三个部分组成分别是两个编码器分别提取可见光和红外特征区域自适应动态融合模块用来进行跨模态、跨区域的特征整合最后由解码器重建融合后的图像。网络只对可见光的亮度Y通道和红外图进行处理并输出融合之后的 Y 通道。图 2 RegionFuse 整体结构图包括 MoRA 和 RFCM① 多粒度编码器 MGT面对区域明暗不一的图像要同时保留局部细节比如过曝、过暗处的纹理又不能使全局产生割裂。所以编码器用的是 X-Restormer兼顾了两种粒度的特征提取。② 区域注意力混合机制 MoRA核心创新MoRA 将专家混合MoE任务分解的能力和注意力的特征交互的能力结合起来分成三步进行1切分区域将特征图分成一个个“区域 token”并且加入随着深度增加而重叠划分的方法来减轻边界处亮度突变的问题。2区域路由一个“像素分布感知路由器”来判断各个区域属于哪一种分布并给它们打分然后决定把问题交给哪个专家。3专家分工用注意力掩码使得每个专家只能在“分布相似的区域”之间进行交流并且根据打分进行加权合并。 一句话就是明暗相似的地方由同一位专家来处理。③ 区域特征压缩模块 RFCM高分辨率特征做注意力计算的成本很高。RFCM 放在每个注意力块之后通过通道注意力来加强重要的部分抑制多余的特征并用 1×1 卷积进行降维压缩从而获得更加紧凑且具有判别性的融合表示。④ 增强型强度损失传统强度损失是逐像素取最大值在过曝的时候会塞进很多可见光在正常的光照条件下也会塞进多余的红外。作者用的是以局部梯度为基础的掩码来进行合并哪个模态在这个区域的细节更丰富就相信哪个。总的损失是由强度损失、梯度损失以及负载均衡损失三者组成的。04 实验的效果怎么样 EXPERIMENTS主流方法对比在MSRS、RoadScene、M3FD、TNO 四个公开数据集中和 PIAFusion、CDDFuse、DDFM 等七种先进的方法相比在各个方面的表现都更好。更重要的是模型只在 MSRS 上进行训练并不需要对其他三个数据集进行微调就可以得到很好的结果说明它有很强的泛化能力。表 1、图 3、图 4 定量比较和定性效果图鲁棒性的极端光照下作者人为地提高了对比度从而产生了同时出现过曝和欠曝的情况。随着失真程度参数 k的增大RegionFuse 的优势就越突出再一次证明了它对于明暗不均场景的适应能力。图 5、图 6 极端光照增强示例以及不同 k 值下各项指标对比曲线消融实验和专家可视化逐一去掉 MGT、MoRA、RFCM 等模块都会造成性能下降说明每个设计都是必不可少的。特别是当把“区域自适应”简化为“样本自适应”的时候效果就会大打折扣——这也正是区域级融合比全局级融合更好的证明。可视化还可以看出浅层专家只关心简单的明暗变化而深层专家则可以捕捉到重要的物体、背景等高层语义分工很明确。表 2 / 图 7 消融实验以及各位专家注意力掩码可视化下游任务和跨场景扩展在 M3FD 上进行目标检测并用 RegionFuse 融合之后的图像来训练检测器得到了最好的 mAP。另外迁移到近红外和可见光融合NIR-VIS这样的新任务上也仍然全面领先说明区域自适应范式对于复杂的多变场景有很强的适应能力。表 3、表 4、图 8 目标检测和 NIR-VIS 的结果05 总结 CONCLUSIONRegionFuse 提出了一个区域自适应像素分布学习的融合网络把传统的“全图统一融合”细化为“按局部分布动态调整权值”。MoRA区域级专家注意力和RFCM区域特征压缩这两个主要的创新使得网络可以针对不同的区域进行分工处理并且仍然保持紧凑和高效的特性。实验表明在多个 IVIF 基准上都优于现有的方法并且能够提高目标检测等下游任务的表现具有很好的实用性和泛化能力。往期推荐