十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

ICML 2026|光流太“硬”,历史更“稳”:浙大大工提出红外-可见光视频融合新方法

ICML 2026|光流太“硬”,历史更“稳”:浙大大工提出红外-可见光视频融合新方法 ICML 2026DRFusion用稳定历史引导实现抗漂移红外-可见光视频融合1. 用一句话来概括就是对于红外-可见光视频逐帧融合会出现闪烁、光流对齐会出重影、自回归扩散模型会积累误差等问题本文提出了DR Fusion把视频融合起来再做一次建模使历史条件下产生的运动的过程和融合的质量、时间序列稳定性以及目标跟踪的效果都得到了较好的兼顾。图1. 不同视频融合方法的融合质量与时序稳定性对比。2. 论文信息英文题目DRFusion: Drift-Resilient Temporally Consistent Infrared–Visible Video Fusion中文题目DRFusion抗漂移、时序一致的红外-可见光视频融合发表ICML 2026作者Xingyuan Li、Haoyuan Xu、Shulin Li、Xiang Chen、Zhiying Jiang、Jinyuan Liu*作者单位浙江大学计算机科学与技术学院大连理工大学软件学院、大连理工大学—立命馆大学国际信息与软件学院大连海事大学信息科学技术学院代码https://github.com/xhhaoyan/DRFusion下载https://arxiv.org/abs/2605.257753. 论文摘要逐帧图像融合不考虑相邻帧之间的联系会使得亮度、纹理以及目标边沿出现随着时间变化而变化的情况。光流法用刚性的变形来约束相邻帧在快速移动、遮挡或者估计算法出错的时候会产生重影和结构失真的问题。DRFusion 用三维扩散变压器来建模视频中的运动并且利用红外结构条件来控制内容的融合。稳定的历法可以将时间的一致性转换为频率滤波的问题从而保留低频的趋势而抑制高频的波动以及由于误差积累所造成的干扰。4. 核心创新点创新一历史条件运行产生论文不把视频看作一组独立的图片而是在前向过程中学习到当前帧所处的历史背景下的生成概率并且用三维狄特隐式的运动模型来代替光流硬对齐的方法在推理的时候也不需要使用光流算法。创新二稳定的史实来引导作者创建了各种各样的历史情景并且给历史潜变量添加了噪音来对其进行干扰。少量的噪音在频域里就相当于一个软低通滤波器在保持稳定运动趋势的同时也消除了闪烁以及累积伪影。创新三解耦式的结构、运动适配分两步来完成任务第一步是让模型去学习时间上连续的空间表示第二步则是固定住三维狄特的部分参数并且只对条件适配器进行微调在此过程中把热目标的结构加入到生成的过程中去。5. 方法详解5.1 整个结构给出一个红外视频序列与可见光视频序列模型生成出融合视频DRFusion 主要包含以下三个主要部分时序约束的VAE可以得到稳定的潜在空间Condition Adapter 将红外结构注入到冻结的三维数字图像中去推理的时候用稳定的历法来引导、用潜变量去细化从而提高时间上的确定性和目的上的明确性。图2 此图为两阶段训练、红外环境适应、三维-深度图像视频生成、历史帧指引以及潜在变量精炼的过程。5.2 时序约束所占的空间第一种方法是用光流做为软正则在潜在空间里对相邻帧进行限制其中表示潜变量表示光流表示变形操作表示遮挡掩码。**公式解读**模型只对不可见的部分进行限制在相邻帧之间产生潜在变量并且使得潜在空间具有时间上的连贯性。光流只起着一个监督的作用并没有参与到最终视频的硬对齐中去。5.3 红外结构指引第二步是冻结3D-DiT的前向部分并且只对Condition Adapter进行训练其中为了满足红外的要求它是可以看见的光潜变量。公式解读可见光潜变量起着背景纹理的作用红外条件则把热目标的特点表现出来冻结的三维数字图像用来维持运动中的画面。5.4 稳定的历史指引论文提出了三种历史背景用高斯白噪声代替历史帧做为没有历史基础的数据完整的历添加一些噪音来保持稳定的运动趋势只保留最新的那一帧并且要对相邻两帧之间的差别进行说明。最后的速度预估是其中为引导尺度3D-DiT 预测生成的速度。公式解读用来抽取不容易被局部闪烁所干扰的长时间的趋势变化以此来减小自回归误差不断增大。用一句话来概括这个方法就是DRFusion 通过使用红外结构来控制视频扩散模型并且从中抽取到稳定的运动信息之后再对历史帧进行频率滤波。6. 实验结果实验条件本实验对HDO、M3SVD、NOT-156以及VT MOT四个红外-可见光视频数据集进行研究。第一阶段训练50个周期、批量大小为16第二阶段训练100个周期、批量大小为2。使用AdamW作为优化器学习率是推理用的是50步DDIM采样的方法历史窗口大小是8个时间点使用的GPU是两张NVIDIA A40。融合质量用CC、EN和SSIM来衡量时序一致性用BiSWE和MS2RF来评价。6.2 融合的质量和时序的稳定性从表一中的 12 个融合质量的结果来看DRFusion 得到最好的八项以及第二好的两项。表1 DRFusion 在结构上具有很大的优势并且也考虑到了源图象的相关性以及信息量的问题。从时间序列的角度来看在M3SVD和VTMOT的BiSWE、MS2RF等指标中DRFusion都取得了最好的成绩在NOT-156上也得到了最小的MS2RF值。表2 DRFusion可以有效地降低相邻帧之间没有意义的变化。6.3 定性的结论图3表明DRFusion可以很好地保持车、人等物体的红外轮廓并且还保住了可见光背景的纹理信息在此之上目标边界也更为清楚一些。图3 此图对比了热目标的清晰程度、背景纹理以及重影与模糊的情况。图4 M3SVD 数据集上的帧间差异可视化与时序一致性评估。目标跟踪的结果本文用未做任何修改的YOLOv1和ByteTrack在NOT-156上检验了目标跟踪的效果。DRFusion 的AUC值为0.252DP20为0.230SR0.5和SR0.75分别为0.263、0.121并且这三项都排在第一位。表4 NOT-156 数据集上的目标跟踪性能定量对比。DRFusion 产生的视频可以给目标定位以及持续追踪带来更加稳定的数据。图7 在NOT-156上目标追踪的可视化结果。消融实验完整的模型在NOT-156上得到CC0.458、EN6.664、SSIM0.612、BISWE4.816和MS2RF0.332的结果。去掉潜变量之后CC 变为 0.328去掉历史指导之后BiSWE、MS2RF 分别变为了 5.238、0.361表明结构细化和稳定的历 史引导都是必不可少的。表3 完整的模型可以获得最好的效果。图5 消融实验定性比较结果。图6 M3SVD 数据集上不同消融变体的帧间差异与时序一致性对比。模型复杂度论文没有提及参数数量、FLOPs浮点运算次数以及推理的速度。因为推理要进行五十次扩散采样、对各种不同的历史情况进行预测以及对周期性的潜在变量进行细化所以它的计算成本可能会比一般的前馈合并网络大一些。7、总结和展望DRFusion把红外-可见光视频融合建模为基于历史条件生成的过程并且利用了时间序列稳定的潜在空间、红外结构匹配以及历史频率分量滤波来提高融合的效果和长时间内的时序一致度。目前该论文的方法仍然没有对参数数量以及推理速度进行研究在下游实验中主要是针对目标追踪的任务来进行测试。以后可以继续检验它在视频检测、语义分割以及自动驾驶感知等方面的应用效果。一句话总结DRFusion把历史帧和刚性的对齐方式改为用经过频率滤波后的软运动先验来实现时间上的一致性在此基础上进行视频融合的方法也有了新的思路。往期推荐
返回列表