(来源:小白 小白学视觉)
大家好,今天我们要讲的是图像复原领域的一篇新成果——VDMamba。本文提出了一种新的方法把向量分解学习和基于小波的视觉Mamba结合起来来解决图像去雨以及其他的恢复问题。它的主要思想很新颖,而且性能很好,在效率方面也非常好。
论文信息
题目: VDMamba: Vector Decomposition in Vision Mamba for Image Deraining and Beyond
VDMamba:基于向量分解的视觉Mamba方法用于图像去雨及其他任务
作者:Kui Jiang, Junjun Jiang, Shiqi Wang, Wenqi Ren, Chia-Wen Lin, Zhengguo Li
研究背景:去雨之难与Mamba之机
雨线会使图像的视觉质量受到严重的损害,造成细节消失和对比度降低。不但会影响观感,还会对自动驾驶、视频监控等高级视觉任务产生影响。所以图像去雨是底层视觉中一个重要的而且很困难的问题。
传统的做法依靠人工设计的先验条件来实现,比如稀疏性等,但是面对复杂的多变真实雨况时效果不佳。深度学习尤其是卷积神经网络由于具有很强的数据拟合能力而成为主流。但是CNN的局部感受野特性使得它不能够去建模雨线在图像上全局分布的规律。
为了获得整体的信息,研究人员使用了Transformer。它的自注意力机制很有效,但是计算复杂度和图像尺寸的平方成正比,在处理高分辨率图像的时候,巨大的计算和内存消耗让人望而生畏。比如一些高性能的Transformer去雨模型对于一个512x512的图片做推理要花费超过一秒钟的时间。
图1:不同方法在512x512图像上的推理时间、计算量和参数量对比最近,在自然语言处理领域中出现了一种叫做Mamba的状态空间模型。它可以以线性的复杂度来处理长序列并且可以很好地捕获到长距离的相关性。给图像恢复以及特别是要进行全局建模的去雨任务带来希望。但是标准的Mamba是为一维序列设计的,直接用在二维图像上就会丢失掉空间结构的信息。
那么有没有办法既能够利用Mamba高效的建立全局关系模型的优点,又可以符合图像尤其是雨线分布的特点呢?VDMamba的我们给出的是肯定的回答。
核心思想:在频域中分解雨线
VDMamba主要的创新之处就是用一种新的角度来思考问题。它并不是直接在图像像素的空间中和雨线进行碰撞,而是把问题转化到频域的空间里。
具体地讲,我们先对输入的雨图做Haar小波变换,得到低频的近似系数以及高频的垂直、水平、对角系数。小波变换有很好的时频局部化的优点,可以更准确地描述出雨线这样突变的现象。
最重要的一步到来了。我们认为雨线扰动属于频域中的现象,可以用垂直、水平两个方向上的基向量叠加来表示。于是,去雨的过程就变成了频域里拟合并消去这些方向性的基向量的问题。
这就引出论文中最重要的部分,即使用Mamba进行向量分解和合成的部分。
方法详解:VDSM模块的精妙设计
VDMamba整体结构比较清楚,主要由小波变换、特征提取、堆叠的VDSM模块和重建模块组成。它的主要引擎就是VDSM。
图2:VDMamba整体框架图向量分解:方向感知的Mamba扫描
在每个VDSM里,输入的特征会先经过一个巧妙的方向感知投影单元。该单元相当于两块滤光片,可以分别从特征中得到主要表示垂直方向扰动和水平方向扰动的一维向量表征。
然后把这些一维向量送入残差Mamba块里去处理。妙处就在于Mamba天生会处理一维序列。对于垂直向量,Mamba沿垂直方向做单向扫描,主要关注垂直方向上长距离雨线的相关性。对于水平向量也是一样。这样就不需要设计复杂的二维扫描策略了,只用标准的一维Mamba就可以实现对方向特异性的全局关系建模。
互表征与融合:双向耦合,信息互补
但是实际的雨线分布很复杂,垂直、水平分量常常混在一起,很难分开来单独考虑。只分别对待两个方向的话,就会失去重要的信息。
因此VDSM引入了双向耦合互表示的方法。即使垂直方向与水平方向的分量之间进行交流。垂直分量要经过水平方向的投影以及Mamba处理来获取一些补充的信息,反过来也是如此。最后把互补的信息合并到各自的部分里去进行提炼。
该过程使网络同时去探索两种方向分量的互补性以及冗余性,并且大大提高了对于全局退化模式的表征能力,从而使得雨线分解更准确。
向量合成:轻量高效,重建背景
经过互表征精炼之后的垂直、水平雨线残差被送到一个轻量级的合成单元里。该单元学会把两个方向上的分量合并为完整的雨线特征图。然后用当前背景特征减去预测出的雨线特征得到更加纯净的背景特征,作为下一次VDSM的输入。
用多个VDSM级联的方式把雨线扰动从背景里抽离出来。
实验结果:性能与效率的双重胜利
理论很巧妙,但是实际的效果怎么样呢?在很多合成和真实的训练数据集上都做了充分的验证。
图像去雨:效果拔群,效率惊人
在合成雨图数据集上,VDMamba表现出了比之前CNN、Transformer和Mamba更好的效果。它的PSNR值比目前最好的NeRD方法高出了0.58dB。
给人印象最深的就是它的效率很高。和NeRD相比,VDMamba的参数量减少到原来的94.3%,计算量降低到了原来的88.3%,推理时间缩短了77.5%。这就意味着,在获得更好的结果的同时,模型也变得非常轻便,可以很好地应用于移动设备或者边缘端。
表2:在合成去雨数据集上的定量对比结果视觉对比也十分有说服力。VDMamba恢复出来的图片细节更加清楚,色彩也更加真实,在遇到大雨或者复杂的场景的时候可以很好地避免其他的方法所造成的伪影、模糊或者颜色失真的问题。
图3:在合成雨图上的视觉对比在真实的雨图数据集中,VDMamba也表现出了很好的泛化能力,在感知质量指标方面排名靠前。
强大泛化:一法通,万法用?
VDMamba设计的理念不只为了防水。主要的方法就是在频域里做方向性的向量分解和合成,这属于一种与任务无关的策略。我们把这种方法成功地应用到很多图像恢复和改善的任务上,并且都得到了很好的结果。
雨滴去除:在无人机拍摄到的雨滴图片中,VDMamba比专用的方法要好很多,PSNR提高了很多。 雨雾去除:同时解决雨、雾两种退化的现象,使画面更加清晰。 水下图像增强:可以有效地修正水下色彩偏差、恢复细节,并不需要依靠水下的物理模型。 图像去雾:在标准去雾数据集上的表现要好于目前最先进的方法。 低光增强:提高亮度的同时又很好地抑制了噪声以及伪影。
上述实验已经表明了VDMamba框架具有普适性以及有效性。给我们的一个新角度就是把所有的图像退化(雨、雾、水下衰减、低光照等)看作是在变换域里对于方向性的干扰基向量进行拟合和消去的问题。
图7:在多种任务上的视觉对比(去雾、水下增强、低光增强)总结与展望
VDMamba工作得很好。它敏锐地发现出了视觉Mamba和频域向量分解之间存在的内在联系,并且提出了VDSM模块。该模块可以实现高效的全局关系学习,并且利用双向耦合的方式提高特征表示的能力。
该工作所具有的意义就是给基于Mamba的视觉模型的设计提供新的思路,在对于全局建模以及计算效率都有较高要求的任务中尤其如此。VDMamba在精度与效率之间达到了很好的平衡,并且表明了在资源有限的情况下部署高性能AI模型具有很大的潜力。
下一篇:日本政要“拜鬼”,我国防部发声!