游乐游手机版
首页/AI热点日报/热点详情

视觉深度学习模型的规模越大效果越佳吗?

类型:热点整理2026-07-23
一项研究挑战模型越大越好的共识,提出尺度缩放(S2)方法:使用预训练冻结的小型视觉模型处理多尺度图像,在分类、分割、深度估计及多模态基准测试中超越参数多3至14倍的大模型,甚至超越GPT-4V。分析表明,多尺度小模型可线性重建大模型特征,将其纳入预训练可显著提升泛化能力。

在视觉理解领域,一个反直觉的发现正在引起关注:盲目增加模型参数未必是提升性能的最佳路径。过去,业界普遍认为“模型越大,效果越好”——从语言模型到图像生成,再到视觉感知,参数规模几乎成了衡量能力的默认标准。然而,本文试图打破这一惯性思维,提出一种看似简单但高效的新策略:与其扩大模型本身,不如扩大输入图像的尺度。

作者将这种方法命名为“尺度缩放”(S2,Scale Scaling)。其核心思路十分直接:使用一个较小的模型(例如ViT-B或ViT-L),但同时处理多个分辨率的图像。具体实现方式是:将一个预训练好且参数冻结的视觉模型,同时输入不同尺度的图像版本——例如将一张高分辨率图片分别缩放到224、448甚至1008的分辨率,然后每个尺度再切分成标准大小(224²)的子图,逐一通过模型后,最后将特征拼接起来。整个过程无需额外训练,只需增加几步预处理操作。

实验结果令人惊讶:在分类、语义分割、深度估计、多模态大语言模型(MLLM)基准测试以及机器人操作等任务中,配备S2的小模型,在同等算力下,稳定超越了参数多3到14倍的大模型。更令人振奋的是,在V*这种对视觉细节要求极高的测试中,使用1008²分辨率的S2方法配合小模型,竟然超过了GPT-4V和Gemini Pro等商业闭源模型——这是首次有开源方案达到这一高度。

不过,故事并未止步于此。作者进一步追问:小模型加上多尺度,是否真的能逼近大模型的学习能力?通过特征重构实验发现,大模型学到的表示,几乎可以完全由多尺度小模型通过一个简单的线性变换来重建。这意味着,至少在表达能力层面,小模型并不“不够用”,问题反而出在训练方式上——小模型仅用单尺度预训练,限制了其泛化能力。一旦将S2纳入预训练阶段,小模型的泛化能力就能显著提升,甚至在多个基准上持平甚至反超大模型。

1. 论文信息

论文标题和作者信息此处不再赘述,感兴趣的读者可直接查阅原文。关键点在于,这项研究提供了一套完整的对比实验、理论分析以及开源工具包(只需一行代码即可为任意视觉模型套上S2),值得深入研读。

2. 摘要

一句话概括:作者认为,更大的视觉模型并非通往更强理解能力的必经之路。通过S2方法,一个预训练并冻结的小型模型(如ViT-B或ViT-L)在多个图像尺度上运行,即可在分类、分割、深度估计、多模态LLM基准测试和机器人操作中超越大模型(如ViT-H或ViT-G)。尤其在V*基准上,S2加持的模型甚至超越了GPT-4V。作者进一步分析了大模型与小模型的性能差异,发现大模型在困难样本上的泛化优势,实际上可以被多尺度小模型线性逼近。这表明,使用S2预训练小模型,完全有可能达到甚至超越大模型的优势。

3. S2-Wrapper

这个模块是整个方法的执行引擎。它不需要任何参数学习,直接套在已有视觉模型上即可工作。以ViT-B为例:

输入图像首先被插值到多个尺度(例如224²和448²),然后在每个尺度上切成标准大小的子图像(448²可切成4张224²)。将这些子图分别送入预训练好的模型,得到的输出特征按空间位置合并成一张完整大图的特征图(例如从4×16²拼成32²)。接着,不同尺度的特征图被池化到原始空间尺寸,再拼接起来。最终的特征在空间分辨率上没有变化,但通道数翻倍了(例如从768变为1536)——关键是,整个过程只用了一个小模型,却获得了更丰富的多尺度信息。

4. 实验

模型与任务对比:规模缩放 vs 尺度缩放

作者选取了三类模型(ViT、DINOv2、OpenCLIP)和三个任务(ImageNet分类、语义分割、深度估计)进行系统对比。灰色曲线代表经典的模型规模缩放(从小到大的模型参数翻倍),绿色曲线则代表S2缩放(在一个小模型基础上逐步增加多尺度数量)。

关键发现是:在许多场景下,S2缩放的小模型,在算力相近的情况下,性能已经能持平甚至超越大模型。例如在(a)(d)(e)(f)(g)(i)这些子图中,ViT-B加上多尺度之后,表现优于同算力的ViT-L。只有在(c)任务中,S2未能超越模型规模缩放——这也是唯一的例外。因此,整体来看,S2策略的性价比相当出色。

MLLM基准上的表现

在多模态大语言模型相关的三类基准上,S2缩放同样展现出更优的扩展曲线。更大的图像尺度通常会带来更好的性能,而更大的模型在某些情况下反而会拖后腿——这一点很有意思,表明盲目扩大模型并非通用解决方案。

6. 实验结果

模型表达能力分析:特征重建与模型容量

作者使用了三类预训练模型(ImageNet-21k的ViT、LAION-2B的OpenCLIP、ImageNet-1k的MAE)来评估特征重建能力。结果清晰:多尺度小模型几乎总能重建出大模型的大部分特征。例如ViT-B加上S2,重建信息量从0.521提升到0.440,逼近ViT-H的水平。OpenCLIP-Base从92.7%提升到99.9%。所有Base-S2模型的重建比例都接近100%,且从未超过0.5%。这意味着大模型的特征空间,几乎都能被多尺度小模型覆盖。唯一的例外是OpenCLIP-Huge(重建88.9%),但也明显优于单尺度Base模型。这些结果暗示:小模型的学习能力并不差,差的只是预训练时缺乏多尺度信息。

模型容量对比:实例记忆能力

另一组实验测试了模型的“记忆容量”——要求模型记住每张训练图像的具体标签。结果同样有趣:ViT-B加上S2后,其训练损失与ViT-L持平;对于OpenCLIP和DINOv2,情况类似甚至更好。这说明,多尺度小模型的容量根本不输大模型。那么问题来了:为什么小模型在单尺度预训练后表现不佳?答案指向“泛化能力”而非“表达能力”。

S2预训练的效果验证

这才是关键转折点。如果仅在预训练之后才使用S2,小模型确实比不过大模型;但在预训练阶段就引入S2,小模型的性能就会跃升到足以超越大模型。以ViT为例,融合S2预训练后的Base模型,在ImageNet分类上已经能够超过单尺度的Large模型。对于DINOv2,预训练中使用S2也显著提升了Base模型的表现,虽然还略逊于Large模型,但差距已大幅缩小。因此,可以大胆断言:S2预训练是让“小”模型真正发挥潜力的关键一步。

7. 讨论 & 未来工作

这项工作的核心贡献在于提出了一个值得深思的问题:为了更好的视觉理解,真的需要更大的模型吗? 答案显然是否定的,至少在相当多的场景中,S2这种“尺度缩放”策略正在以更低的成本、更优的性价比,重新定义性能边界。

此外,S2还有一些有趣的扩展方向。例如“尺度选择性处理”——并非图像中每个位置都需要所有尺度的信息,未来也许可以根据图像内容和任务需求,动态选择最适合的尺度进行推理,这与人类视觉注意力机制中的选择性关注有些相似。还有“单图像并行处理”——S2天然将一张大图拆成多个独立子图,可以并行计算,对实时性要求高的场景非常友好。

最后,作者的Python包已经发布,一行代码就能给任何视觉模型套上S2——感兴趣的话不妨亲自跑一遍,验证这个“小模型+多尺度”方案到底有多能打。

来源:https://m.elecfans.com/article/2677365.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。