拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RainMamba:基于状态空间模型的视频去雨 · 论文导读与复现路线

RainMamba:基于状态空间模型的视频去雨 · 论文导读与复现路线

RainMamba:基于状态空间模型的视频去雨 · 论文导读与复现路线

系列笔记 · 深度学习模块缝合路线(三)
关联篇:《深度学习模块缝合方法论:人物蒸馏笔记》《视频去雨网络的模块缝合路线 · 实践笔记》

摘要

本文导读视频去雨 Mamba 系三篇:首选 RainMamba(MM 2024 Oral,Hilbert 扫描保留时空局部性,代码权重齐全);对标 VDMamba(CVPR 2025,双分支 SSM 加统计滤波);S3VD 未开源仅参考。文末附环境清单、复现路线与缝合改进点。


目录

  • 摘要
  • 1 选型标准:为什么是这三篇
  • 2 RainMamba(首选基线)
    • 2.1 论文信息
    • 2.2 核心思想
    • 2.3 复现要点
  • 3 VDMamba(进阶对标)
    • 3.1 论文信息
    • 3.2 核心思想
    • 3.3 为什么它是"讲故事的最佳模板"
    • 3.4 复现要点
  • 4 S3VD(只读参考)
  • 5 复现路线与环境清单
    • 5.1 三阶段路线
    • 5.2 环境速查表
  • 6 缝合改进点分析
  • 7 总结
  • 参考文献

1 选型标准:为什么是这三篇

按"有代码、能先跑起来"的实用标准筛选,视频去雨方向 2024–2026 年的代表性工作如下:

论文会议/年份代码预训练权重定位
RainMambaACM MM 2024 Oral✅ 开源✅ 四个数据集首选基线,最容易跑
VDMambaCVPR 2025 Oral✅ 开源✅ 四套权重进阶对标 + 消融对比方法
S3VDarXiv 2609.21322❌ 未开源❌只读,作缝合模块来源参考

三篇恰好构成一条完整的研究链路:RainMamba 解决 Mamba 局部性 → VDMamba 补上统计滤波与半监督 → S3VD 引入语义先验。跑通前两篇、读懂第三篇,就掌握了当前视频去雨的技术主干。

2 RainMamba(首选基线)

2.1 论文信息

  • 标题:RainMamba: Enhanced Locality Learning with State Space Models for Video Deraining
  • 机构:香港科技大学(广州)
  • 发表:ACM MM 2024,Oral
  • 代码:github.com/TonyHongtaoWu/RainMamba(2024-07-30 发布,训练、测试代码、预训练模型、四个数据集结果全部放出)

2.2 核心思想

Mamba(状态空间模型)以线性复杂度建模长序列,但视频任务有一个先天矛盾:将 5D 视频张量展平成 1D 序列会破坏时空局部相关性——相邻像素可能在序列上相距很远,状态空间的"遗忘"特性导致局部细节(正是雨纹所在的高频信息)丢失。

RainMamba 的两个针对性设计:

  1. 3D Hilbert 扫描:用三维希尔伯特曲线替代简单展平做序列化。Hilbert 曲线是空间填充曲线,任意相邻两点在序列上也相邻,从而在 Mamba 的序列建模中保留时空局部性。这是"改造序列化方式"而非"改造 Mamba 本身"的思路,迁移性好。
  2. 差分引导的动态对比局部学习:利用雨图与干净图的差分图(即雨纹本身)作为引导信号,动态调整局部学习权重,让网络聚焦于雨纹区域而非整幅图像。

2.3 复现要点

  • 框架:基于 MMEditing 构建,Python 3.9 + PyTorch 2.1.1 + mmcv-full 1.7.2
  • 必坑项:需编译causal-conv1d与mamba两个 CUDA 扩展——这是 Mamba 系项目的通用坑,强烈建议 Linux + GPU 环境(实验室服务器或云 GPU),Windows 本地编译这两个包非常痛苦
  • 数据集:NTURain、RainSynLight25、RainSynComplex25 等论文所用数据集均可从对应官网获取,仓库 README 有链接

3 VDMamba(进阶对标)

3.1 论文信息

  • 标题:Semi-Supervised State-Space Model with Dynamic Stacking Filter for Real-World Video Deraining
  • 机构:中科院
  • 发表:CVPR 2025,Oral(arXiv 2505.16811)
  • 代码:github.com/sunshangquan/VDMamba,预训练权重覆盖 NTURain / RainSynLight25 / RainSynComplex25 / RVDT 四套,附现成测试脚本

3.2 核心思想

三个递进的创新点:

  1. 时空双分支 SSM:空间分支与时序分支解耦建模,避免单一序列化方式同时照顾两种维度的局部性(可视为对 RainMamba 思路的进一步拆分)。
  2. 动态统计滤波(DSF):利用雨纹的稀疏性——雨只占画面少数像素——将 median、min-max 等统计滤波做可微化近似嵌入网络。统计滤波对稀疏离群值天然鲁棒,可微化后可以端到端训练。这是"先验知识模块化"的典型范例。
  3. 半监督伪标签:真实雨天视频没有干净标签,用无标签真实数据 + 伪标签一致性约束做半监督训练,缓解合成数据到真实场景的域差距。同时构建了真实场景基准RVDT。

3.3 为什么它是"讲故事的最佳模板"

VDMamba 不只报 PSNR/SSIM,还报告了去雨后的下游收益——目标检测 mAP、多目标跟踪 MOTA 的提升。这把"去雨"从刷指标包装成了"为下游视觉任务服务"的应用价值叙事,审稿人认可度高,值得直接借鉴到自己的论文写作中。

3.4 复现要点

  • 环境:Python 3.10 + PyTorch 2.1.1
  • 必坑项:需额外编译 flownet2 的correlation_package(光流模块),比 RainMamba 麻烦一点;同样建议 Linux 环境
  • 定位:跑通后作为自己方法的对比方法,消融表里正好要用

4 S3VD(只读参考)

  • arXiv 2609.21322(2026-09),当前 PSNR 最优
  • DINOv2 语义先验:冻结的 DINOv2 提取语义特征,经交叉注意力注入去雨主干,防止背景结构被"洗掉"——对应前篇笔记的"先验注入"拓扑
  • 解耦门控 Mamba:门控机制动态平衡雨纹抑制与结构保留
  • 代码未开源,只适合精读,作为未来缝合的模块来源

5 复现路线与环境清单

5.1 三阶段路线

阶段一(第 1–2 周):跑通 RainMamba ├─ Linux + GPU 环境(RTX 3090/4090 或云 GPU) ├─ 安装 PyTorch 2.1.1 + mmcv-full 1.7.2 ├─ 编译 causal-conv1d、mamba CUDA 扩展 ├─ 下载预训练权重,先测试复现论文指标 └─ 准备数据集,完整重训一遍验证环境 阶段二(第 3 周):跑通 VDMamba 作对比 ├─ 编译 flownet2 correlation_package ├─ 复现四套权重对应的指标 └─ 整理成对比方法表格 阶段三(第 4 周起):定位缝合点 ├─ 分析 RainMamba 短板(见下节) └─ 一次只缝一个模块,逐项消融

5.2 环境速查表

项目RainMambaVDMamba
Python3.93.10
PyTorch2.1.12.1.1
框架依赖mmcv-full 1.7.2(MMEditing)无
CUDA 扩展causal-conv1d、mambaflownet2 correlation_package
系统Linux(强烈建议)Linux(强烈建议)

6 缝合改进点分析

RainMamba 论文自己承认 Hilbert 扫描解决了局部性,但仍留有两处明显缺口,正好对应前篇笔记的拓扑法则:

  1. 无语义先验(→ 先验注入式缝合):仿照 S3VD,冻结 DINOv2 提取语义特征,经交叉注意力注入 RainMamba 的解码端。改动集中在一个模块,风险低。
  2. 无显式光流对齐(→ 串行式缝合):仿照 VDMamba,在时序分支前加光流或可变形卷积做帧间 warp,缓解大运动下的对齐误差。

按"五步链路"组织:跑通基线(RainMamba)→ 选模块(DINOv2 先验 / 光流对齐)→ 定拓扑(注入式 / 串行式)→ 对齐维度(注意 5D 张量 reshape)→ 回归验证(一次一个,逐项消融)。

差异化提醒:S3VD 与 VDMamba 是 2025–2026 的 SOTA,直接搬模块要注意与自己的贡献点拉开差异——组合方式本身(缝在哪、怎么融合、损失怎么配)才是您的创新点。

7 总结

  • 跑:RainMamba 是当前最易上手的 Mamba 系视频去雨基线,代码权重齐全,但需 Linux 环境编译 CUDA 扩展
  • 比:VDMamba 是现成的对比方法,且其"下游收益"叙事值得借鉴
  • 读:S3VD 指明了语义先验方向,是缝合模块的思想来源
  • 缝:语义先验注入 + 光流对齐是 RainMamba 的两个现成缺口,按五步链路逐项消融推进

参考文献

  1. Wu T, et al. RainMamba: Enhanced Locality Learning with State Space Models for Video Deraining. ACM MM 2024 (Oral). Code: github.com/TonyHongtaoWu/RainMamba
  2. Sun S, et al. Semi-Supervised State-Space Model with Dynamic Stacking Filter for Real-World Video Deraining. CVPR 2025 (Oral). arXiv:2505.16811. Code: github.com/sunshangquan/VDMamba
  3. S3VD: arXiv:2609.21322, 2026.
  4. 本系列前篇:《深度学习模块缝合方法论:人物蒸馏笔记》《视频去雨网络的模块缝合路线 · 实践笔记》
返回列表