ICPR 2022 | PyNet-V2 Mobile:分组残差+通道/空间双注意力,手机端12MP RAW照片1.5秒直出!
这篇论文最有意思的地方,不是把注意力机制简单地塞进网络,而是在移动端 AI 加速器只支持 101 种算子、RAM 极其有限的苛刻约束下,用"分组残差 + 通道/空间双注意力"把整个 RAW 到 RGB 的 ISP 流程压进 3.6MB 的模型里——12MP 照片端到端直出,画质却逼近中画幅专业相机。论文: PyNet-V2 Mobile: Efficient On-Device Photo Processing With Neural Networks作者: Andrey Ignatov, Grigory Malivenko, Radu Timofte, Yu Tseng, Yu-Syuan Xu, Po-Hsiang Yu, Cheng-Ming Chiang, Hsien-Kai Kuo, Min-Hung Chen, Chia-Ming Cheng, Luc Van Gool发表单位: ETH Zurich / AI Witchlabs / University of Würzburg / MediaTek Inc.发表: ICPR 2022论文链接: https://arxiv.org/abs/2211.06263代码链接: https://github.com/gmalivenko/PyNET-v2一、引言手机已成为普通人拍照的主要设备,但小尺寸传感器在动态范围、噪点、色彩上都远逊于专业相机。传统 ISP(图像信号处理)流水线依赖手工设计的去马赛克、降噪、锐化等模块,已很难再榨出多少画质提升。于是"用深度学习直接替代整个 ISP"(learned ISP)成为热点方向:输入 RAW 数据,端到端输出高质量 RGB 照片。此前的代表性工作 PyNET [32] 已证明这条路可行,但它的模型高达数百 MB、计算量巨大,一张 12MP 照片在手机 GPU 上推理直接 OOM(内存溢出),根本无法落地。而另一类为速度设计的轻量模型(FSRCNN、SmallNet 等)虽然跑得快,画质却明显拉胯,噪声抑制和色彩还原基本不可用。本文提出的PyNet-V2 Mobile正是要填上这个鸿沟:在移动 AI 加速器的算子约束、内存约束、体积约束下,实现高画质 + 低延迟的端到端 RAW 照片处理。二、核心动机移动端端到端 ISP 的三重约束任务复杂度:模型既要完成全局调整(亮度、白平衡、色彩还原),又要完成局部处理(纹理增强、降噪、2 倍超分)。ResNet/U-Net 等单一结构只能顾一头。硬件算子限制:Android NNAPI 1.2 只支持有限算子(最新系统最多 101 种,老系统甚至不足 28 种),并且 RAM 极小——FullHD 推理可用内存往往只有几百 MB。体积限制:模型需要随相机应用一起打包,数百 MB 的模型不可接受。关键观察原版 PyNET 之所以"重",主要因为:每个尺度通道数逐级翻倍(高达 512 通道)、大量大卷积核与转置卷积、以及缺少轻量化的全局建模手段。作者观察到:移动端模型应当在尺度变大时"越用越省"——高层通道数减半,并仅用 3×3 卷积 + 分组卷积 + 轻量注意力,就能在算子允许的范围内同时获得全局调整与局部重建能力。三、方法3.1 模块整体设计PyNet-V2 Mobile 整体架构采用倒金字塔(inverted pyramid)三级尺度结构,数据流为:输入 RAW RGBG Bayer 数据,经space-to-depth拆分为 4 个通道(对应 B/Gb/R/Gr);依次经过 3 个尺度(Level 3 → Level 2 → Level 1)处理,每个尺度完成一次"下采样、残差处理、输出预测";低尺度特征经双线性上采样后与高尺度特征拼接,实现逐级细化;每个尺度末端输出tanh\text{tanh}tanh激活的 RGB 结果,最终取最高分辨率输出。通道配置为 32 → 64 → 128(每升高一个尺度翻倍),但相比原版 PyNET 每尺度通道数整体减半,3×3 卷积 + PReLU 为基本操作,最后输出层用 Tanh 将结果映射到(−1,1)(-1, 1)(−1,1):out=0.58⋅tanh(z)+0.5\text{out} = 0.58 \cdot \tanh(z) + 0.5out=0.58⋅tanh(z)+0.53.2 关键操作:Space-to-depth 输入输入为原始 Bayer 数据I∈RH×WI \in \mathbb{R}^{H \times W}I∈RH×W,通过 space-to-depth 操作拆成 4 通道:IBayer→space-to-depthI^∈RH2×W2×4I_{\text{Bayer}} \xrightarrow{\text{space-to-depth}} \hat{I} \in \mathbb{R}^{\frac{H}{2} \times \frac{W}{2} \times 4}IBayerspace-to-depthI^∈R2H×2W×4chB=I[1::2,1::2],chGb=I[0::2,1::2],chR=I[0::2,0::2],chGr=I[1::2,0::2]\text{ch}_B = I[1::2, 1::2], \quad \text{ch}_{Gb} = I[0::2, 1::2], \quad \text{ch}_R = I[0::2, 0::2], \quad \text{ch}_{Gr} = I[1::2, 0::2]chB=I[1::2,1::2],chGb=I[0::2,1::2],chR=I[0::2,0::2],chGr=I[1::2,0::2]这样既保留了 Bayer 的颜色相位信息,又天然完成了 2 倍下采样,与末端 depth-to-space 上采样形成对称结构。3.3 核心子模块(1) 分组残差块(Grouped Residual Block)将输入按通道拆成GGG组(2~4 组),各组并行执行nnn次 3×3 卷积(偶数分组额外施加实例归一化 InstanceNorm),再拼接、经 1×1 卷积恢复通道数后与输入相加:xout=x+f1×1([ gi+f3×3(gi) ]i=1G),gi=x[:,:,:,iCG:(i+1)CG]x_{\text{out}} = x + f_{1\times1}\Big(\Big[\, g_i + f_{3\times3}(g_i) \,\Big]_{i=1}^{G}\Big), \quad g_i = x\Big[:, :, :, \tfrac{iC}{G}:\tfrac{(i+1)C}{G}\Big]x