RainMamba:基于状态空间模型的视频去雨 · 论文导读与复现路线
系列笔记 · 深度学习模块缝合路线(三)
关联篇:《深度学习模块缝合方法论:人物蒸馏笔记》《视频去雨网络的模块缝合路线 · 实践笔记》
摘要
本文导读视频去雨 Mamba 系三篇:首选 RainMamba(MM 2024 Oral,Hilbert 扫描保留时空局部性,代码权重齐全);对标 VDMamba(CVPR 2025,双分支 SSM 加统计滤波);S3VD 未开源仅参考。文末附环境清单、复现路线与缝合改进点。
目录
- 摘要
- 1 选型标准:为什么是这三篇
- 2 RainMamba(首选基线)
- 2.1 论文信息
- 2.2 核心思想
- 2.3 复现要点
- 3 VDMamba(进阶对标)
- 3.1 论文信息
- 3.2 核心思想
- 3.3 为什么它是"讲故事的最佳模板"
- 3.4 复现要点
- 4 S3VD(只读参考)
- 5 复现路线与环境清单
- 5.1 三阶段路线
- 5.2 环境速查表
- 6 缝合改进点分析
- 7 总结
- 参考文献
1 选型标准:为什么是这三篇
按"有代码、能先跑起来"的实用标准筛选,视频去雨方向 2024–2026 年的代表性工作如下:
| 论文 | 会议/年份 | 代码 | 预训练权重 | 定位 |
|---|---|---|---|---|
| RainMamba | ACM MM 2024 Oral | ✅ 开源 | ✅ 四个数据集 | 首选基线,最容易跑 |
| VDMamba | CVPR 2025 Oral | ✅ 开源 | ✅ 四套权重 | 进阶对标 + 消融对比方法 |
| S3VD | arXiv 2609.21322 | ❌ 未开源 | ❌ | 只读,作缝合模块来源参考 |
三篇恰好构成一条完整的研究链路:RainMamba 解决 Mamba 局部性 → VDMamba 补上统计滤波与半监督 → S3VD 引入语义先验。跑通前两篇、读懂第三篇,就掌握了当前视频去雨的技术主干。
2 RainMamba(首选基线)
2.1 论文信息
- 标题:RainMamba: Enhanced Locality Learning with State Space Models for Video Deraining
- 机构:香港科技大学(广州)
- 发表:ACM MM 2024,Oral
- 代码:
github.com/TonyHongtaoWu/RainMamba(2024-07-30 发布,训练、测试代码、预训练模型、四个数据集结果全部放出)
2.2 核心思想
Mamba(状态空间模型)以线性复杂度建模长序列,但视频任务有一个先天矛盾:将 5D 视频张量展平成 1D 序列会破坏时空局部相关性——相邻像素可能在序列上相距很远,状态空间的"遗忘"特性导致局部细节(正是雨纹所在的高频信息)丢失。
RainMamba 的两个针对性设计:
- 3D Hilbert 扫描:用三维希尔伯特曲线替代简单展平做序列化。Hilbert 曲线是空间填充曲线,任意相邻两点在序列上也相邻,从而在 Mamba 的序列建模中保留时空局部性。这是"改造序列化方式"而非"改造 Mamba 本身"的思路,迁移性好。
- 差分引导的动态对比局部学习:利用雨图与干净图的差分图(即雨纹本身)作为引导信号,动态调整局部学习权重,让网络聚焦于雨纹区域而非整幅图像。
2.3 复现要点
- 框架:基于 MMEditing 构建,
Python 3.9 + PyTorch 2.1.1 + mmcv-full 1.7.2 - 必坑项:需编译
causal-conv1d与mamba两个 CUDA 扩展——这是 Mamba 系项目的通用坑,强烈建议 Linux + GPU 环境(实验室服务器或云 GPU),Windows 本地编译这两个包非常痛苦 - 数据集:NTURain、RainSynLight25、RainSynComplex25 等论文所用数据集均可从对应官网获取,仓库 README 有链接
3 VDMamba(进阶对标)
3.1 论文信息
- 标题:Semi-Supervised State-Space Model with Dynamic Stacking Filter for Real-World Video Deraining
- 机构:中科院
- 发表:CVPR 2025,Oral(arXiv 2505.16811)
- 代码:
github.com/sunshangquan/VDMamba,预训练权重覆盖 NTURain / RainSynLight25 / RainSynComplex25 / RVDT 四套,附现成测试脚本
3.2 核心思想
三个递进的创新点:
- 时空双分支 SSM:空间分支与时序分支解耦建模,避免单一序列化方式同时照顾两种维度的局部性(可视为对 RainMamba 思路的进一步拆分)。
- 动态统计滤波(DSF):利用雨纹的稀疏性——雨只占画面少数像素——将 median、min-max 等统计滤波做可微化近似嵌入网络。统计滤波对稀疏离群值天然鲁棒,可微化后可以端到端训练。这是"先验知识模块化"的典型范例。
- 半监督伪标签:真实雨天视频没有干净标签,用无标签真实数据 + 伪标签一致性约束做半监督训练,缓解合成数据到真实场景的域差距。同时构建了真实场景基准RVDT。
3.3 为什么它是"讲故事的最佳模板"
VDMamba 不只报 PSNR/SSIM,还报告了去雨后的下游收益——目标检测 mAP、多目标跟踪 MOTA 的提升。这把"去雨"从刷指标包装成了"为下游视觉任务服务"的应用价值叙事,审稿人认可度高,值得直接借鉴到自己的论文写作中。
3.4 复现要点
- 环境:
Python 3.10 + PyTorch 2.1.1 - 必坑项:需额外编译 flownet2 的
correlation_package(光流模块),比 RainMamba 麻烦一点;同样建议 Linux 环境 - 定位:跑通后作为自己方法的对比方法,消融表里正好要用
4 S3VD(只读参考)
- arXiv 2609.21322(2026-09),当前 PSNR 最优
- DINOv2 语义先验:冻结的 DINOv2 提取语义特征,经交叉注意力注入去雨主干,防止背景结构被"洗掉"——对应前篇笔记的"先验注入"拓扑
- 解耦门控 Mamba:门控机制动态平衡雨纹抑制与结构保留
- 代码未开源,只适合精读,作为未来缝合的模块来源
5 复现路线与环境清单
5.1 三阶段路线
阶段一(第 1–2 周):跑通 RainMamba ├─ Linux + GPU 环境(RTX 3090/4090 或云 GPU) ├─ 安装 PyTorch 2.1.1 + mmcv-full 1.7.2 ├─ 编译 causal-conv1d、mamba CUDA 扩展 ├─ 下载预训练权重,先测试复现论文指标 └─ 准备数据集,完整重训一遍验证环境 阶段二(第 3 周):跑通 VDMamba 作对比 ├─ 编译 flownet2 correlation_package ├─ 复现四套权重对应的指标 └─ 整理成对比方法表格 阶段三(第 4 周起):定位缝合点 ├─ 分析 RainMamba 短板(见下节) └─ 一次只缝一个模块,逐项消融5.2 环境速查表
| 项目 | RainMamba | VDMamba |
|---|---|---|
| Python | 3.9 | 3.10 |
| PyTorch | 2.1.1 | 2.1.1 |
| 框架依赖 | mmcv-full 1.7.2(MMEditing) | 无 |
| CUDA 扩展 | causal-conv1d、mamba | flownet2 correlation_package |
| 系统 | Linux(强烈建议) | Linux(强烈建议) |
6 缝合改进点分析
RainMamba 论文自己承认 Hilbert 扫描解决了局部性,但仍留有两处明显缺口,正好对应前篇笔记的拓扑法则:
- 无语义先验(→ 先验注入式缝合):仿照 S3VD,冻结 DINOv2 提取语义特征,经交叉注意力注入 RainMamba 的解码端。改动集中在一个模块,风险低。
- 无显式光流对齐(→ 串行式缝合):仿照 VDMamba,在时序分支前加光流或可变形卷积做帧间 warp,缓解大运动下的对齐误差。
按"五步链路"组织:跑通基线(RainMamba)→ 选模块(DINOv2 先验 / 光流对齐)→ 定拓扑(注入式 / 串行式)→ 对齐维度(注意 5D 张量 reshape)→ 回归验证(一次一个,逐项消融)。
差异化提醒:S3VD 与 VDMamba 是 2025–2026 的 SOTA,直接搬模块要注意与自己的贡献点拉开差异——组合方式本身(缝在哪、怎么融合、损失怎么配)才是您的创新点。
7 总结
- 跑:RainMamba 是当前最易上手的 Mamba 系视频去雨基线,代码权重齐全,但需 Linux 环境编译 CUDA 扩展
- 比:VDMamba 是现成的对比方法,且其"下游收益"叙事值得借鉴
- 读:S3VD 指明了语义先验方向,是缝合模块的思想来源
- 缝:语义先验注入 + 光流对齐是 RainMamba 的两个现成缺口,按五步链路逐项消融推进
参考文献
- Wu T, et al. RainMamba: Enhanced Locality Learning with State Space Models for Video Deraining. ACM MM 2024 (Oral). Code: github.com/TonyHongtaoWu/RainMamba
- Sun S, et al. Semi-Supervised State-Space Model with Dynamic Stacking Filter for Real-World Video Deraining. CVPR 2025 (Oral). arXiv:2505.16811. Code: github.com/sunshangquan/VDMamba
- S3VD: arXiv:2609.21322, 2026.
- 本系列前篇:《深度学习模块缝合方法论:人物蒸馏笔记》《视频去雨网络的模块缝合路线 · 实践笔记》