游乐游手机版
首页/AI热点日报/热点详情

简单而高效的深度CNN模型用于图像超分辨率

类型:热点整理2026-07-20
提出一种基于空间自适应特征调制(SAFM)与卷积通道混合器(CCM)的轻量级深度CNN模型SAFMN,用于高效图像超分辨率。SAFM通过多尺度特征实现全局交互,CCM补充局部上下文。相比IMDN,参数量减少3倍且性能不减。

探讨超分辨率领域的效率优化问题。近年来,学术界与工业界提出了多种图像超分辨率方案,但普遍面临计算开销大、内存占用高、部署困难等痛点。

本文介绍的工作,核心思路在于设计一种既简洁又高效的深度网络。关键创新在于,基于Vision Transformer (ViT) 模块,提出了一种空间自适应特征调制机制 (Spatial-Adaptive Feature Modulation, SAFM)。简而言之,在输入特征上先通过SAFM模块进行动态筛选,提取最具代表性的特征。由于SAFM模块从全局视角处理特征,还需补充局部上下文信息。为此,作者引入了一个卷积通道混合器 (Convolutional Channel Mixer, CCM),其任务是在提取局部上下文的同时完成通道间的信息混合。

实验数据充分说明:与当前最高效的超分辨率方法之一IMDN相比,SAFMN网络的参数量缩小了3倍,计算成本更低,且性能并未下降。这种平衡性表现令人印象深刻。

性能与效率对比图,圆圈大小表示参数量,PSNR为峰值信噪比

LAM结果展示了在超分辨率过程中,用红色框标记的patch时,输入低分辨率图像中每个像素的重要性。DI值反映了所涉及像素的范围,数值越大,关注范围越广。

SAFMN的核心思路

与经典注意力模块相比,本文主要做了两项调整:用SAFM替代多头注意力,用CCM替代MLP。整体架构十分简洁。

具体来看SAFMN网络结构。它主要由两部分堆叠而成:特征混合模块 (Feature Mixing Module, FMM) 和上采样层。流程上,首先通过一个3×3卷积从输入的低分辨率图中提取浅层特征F0,然后由多个FMM模块接力工作,从中提炼出更精细的深度特征。每个FMM内部包含一个SAFM子层和一个CCM子层。最后重建高分辨率图像时,引入全局残差连接专门学习高频细节,再使用一个仅包含3×3卷积和亚像素卷积的轻量级上采样层快速完成重建。

整个网络可以用如下形式化表达:

空间自适应特征调制的奥妙

SAFM模块是整个工作的技术核心。其目标明确:实现类似注意力机制的全局交互效果,但避免过大的计算代价。解决思路巧妙——通过融合多尺度特征来间接捕捉远距离依赖关系。

其工作流程大致如下:

第一步,将输入的特征图沿通道维度拆分为四份(蓝色、绿色、黄色、橙色四个块),每个子特征图空间尺寸不变,但通道数减少。

第二步,对这四份特征图进行不同的空间尺度变换。例如,保留一份不动(图中橙色特征图),另外三份分别进行2倍、4倍、8倍的下采样。这样便获得了四种不同尺度的特征图。

随后,对它们分别进行深度可分离卷积。关键在于:尺度更小的特征图(如8倍下采样),其每个像素对应的原始图像感受野最大。即使卷积核大小相同,不同尺度特征图中像素的感受野也完全不同。完成卷积后,将下采样过的特征图通过最近邻插值依次上采样回原始尺寸。

从SAFM学习到的不同尺度的深层特征

这样一来,所有特征图的空间尺寸(高和宽)对齐,可直接在通道维度上拼接。最后使用一个1×1卷积,将四个之前未相互交互的子特征在通道层面融合,完成整个处理流程。

卷积通道混合器

SAFM负责探索全局信息,但高分辨率重建同样依赖局部上下文。为此,作者提出基于FMBConv的CCM来增强局部空间建模和通道混合。其结构紧凑:一个3×3卷积加一个1×1卷积。3×3卷积负责编码空间局部上下文,同时将输入特征通道数翻倍;1×1卷积再降回原始维度。中间使用GELU激活函数进行非线性映射。

CCM结构示意

与原始注意力机制中的MLP相比,主要区别在于将全连接层替换为3×3卷积,激活函数从ReLU换为GELU。

与原始FMBConv相比,作者还做了两处适配性修改:一是去除了SE块 (Squeeze-and-Excitation),因为SAFM本身已具备对通道维度的动态效用,去除后性能不降;二是用LayerNorm替换BatchNorm,并移至卷积之前。LayerNorm的训练稳定性更优,对结果也有提升。

损失函数

训练过程中,结合了平均绝对误差 (MAE) 损失和基于快速傅里叶变换 (FFT) 的频率损失来优化参数。公式定义如下:

特征混合模块

遵循ViT式网络设计——即全局特征聚合的自注意力模块加上细化特征的前馈网络,作者将SAFM和CCM结合成一个统一的FMM,用于选择最具代表性的特征。其数学表达为:

实验与评估

评价指标

评估采用PSNR和SSIM两个标准指标。所有数值均在YCbCr空间的Y通道(亮度通道)上计算。对于彩色图像,PSNR计算有三种常见做法:分别计算RGB三通道取平均;计算三通道MSE再除以3;或像本文一样只计算Y分量。

定量比较

对比实验,#Acts表示卷积层输出的所有元素数量。#FLOPs和#Acts测量对应于大小为1280 × 720像素的HR图像。红色表示性能最优。空白条目表示未报告结果或无法从先前工作中获取。∗表示结果通过结构重参数化技术获得。

定性比较

上图展示了×3倍超分辨率在Urban100数据集上的视觉比较。可以看出,对于平行线和网格纹理等细节,SAFMN生成的准确度明显优于其他方法。

内存与运行时间

在×4超分辨率任务上的内存和运行时间比较。#GPU Mem.表示推理阶段的最大GPU内存消耗,由PyTorch的torch.cuda.max_memory_allocated()函数导出。#Avg.Time是50张LR图像(大小为320 × 180像素)的平均运行时间。

作者在×4超分辨率上对比了CARN-M、CARN、EDSR-baseline、IMDN和LAPAR-A五种代表性方法。推理时记录峰值GPU内存,并在50张320×180分辨率的测试图上计算平均运行时间。

消融实验

在DIV2K-val和Manga109数据集上进行的SAFMN消融实验。基线的缩放因子为×4。“None”表示删除该操作。“lr”表示学习率。“FBN”是“Frozen BatchNorm”的缩写。L2 normalization表示输入在通道维度上被L2范数归一化。“FM”、“MR”和“FA”分别是特征调制、多尺度表示和特征融合的缩写。∗表示在训练坍塌之前获得了相应结果。#Params、#FLOPs和#Acts由fvcore库在输入分辨率为320×180像素时计算。

总结

本文提出的SAFMN,是一个简洁而高效的深度CNN模型,专门用于解决高效图像超分辨率问题。其核心在于基于多尺度特征表示的调制机制实现长程自适应,同时配合紧凑的卷积通道混合器补充局部上下文信息并完成通道混合。整体来看,在效率与性能之间找到了一个良好的平衡点。

来源:https://m.elecfans.com/article/2259307.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。