先看几组有意思的数据。多家研究机构联合发布的 BabyVision 视觉推理基准测试,给当前最顶尖的多模态大模型来了次“儿童智力测验”。结果相当扎心:哪怕表现最好的 Gemini 3 Pro Preview,综合得分也仅仅勉强超过3岁小孩的水平,跟6岁儿童比还有大约20%的差距,更别提成年人了——人类乘人的准确率高达94.1%,这个差距可不是一星半点。

这项研究由 UniPat AI、xbench、阿里巴巴、月之暗面、阶跃星辰等团队联合推进。具体来看,Gemini 3 Pro Preview 以49.7%的得分领跑闭源模型;紧随其后的是 GPT‑5.2(34.4%)和豆包 Seed‑1.8(30.2%)。其他模型就逊色不少了:Qwen3‑VL‑Plus 只有19.2%,Grok‑4 是16.2%,Claude 4.5 Opus 更是低至14.2%。开源阵营里,Qwen3VL‑235B‑Thinking 以22.2%暂居第一,但依然没法和主流闭源模型正面硬刚。
问题出在哪儿?研究指出,现在大多数多模态模型的推理方式,本质上是“先把图像翻译成语言,再靠语言模型做逻辑推算”。这种架构在面对细粒度几何判断、空间方位关系、路径连续性追踪这类高度依赖非语言感知能力的任务时,先天就吃亏。结果就是,在「找不同」「连线匹配」「空间构型想象」「视觉规律归纳」这些典型题目上,模型频频翻车。
BabyVision 基准把视觉推理能力拆成四个维度:细粒度辨别、视觉追踪、空间感知和视觉模式识别。所有参评模型在这四个方向上无一例外都暴露出了系统性短板。比如,Gemini 3 Pro Preview 在拼图配对、轨迹连线、三维结构反推这类题上多次给出错误答案;Qwen3‑VL‑Plus 也没能通过视觉规律归纳的考验。
研究团队进一步提炼出模型在视觉推理上面临的四类根本性挑战:
- 非言语性的微细节信息难以保真,导致模型没法识别图像间的细微差异;
- 流形一致性缺失,在复杂动态路径中很难维持稳定的追踪;
- 空间想象能力薄弱,无法从二维输入可靠地构建出一致的三维心理表征;
- 视觉模式抽象与归纳能力不足,难以从有限的样本里提炼出可泛化的结构规则。
那么,怎么突破这种“语言中心化”的视觉推理瓶颈?研究给出了两条技术路径:一是基于可验证奖励信号的强化学习(RLVR),二是基于生成模型的原生视觉推理。实验数据挺说明问题:Qwen3‑VL‑8B‑Thinking 经过 RLVR 微调后,整体准确率提升了大约4.8个百分点;在 BabyVision‑Gen 生成式推理子集测试中,NanoBanana‑Pro 以18.3%的准确率领先于 GPT‑Image‑1.5 和 Qwen‑Image‑Edit。
研究判断,未来多模态智能的发展重心,正在从“语言驱动型理解”转向“视觉原生型推理”。像 Bagel 这样的统一架构,以及具备显式物理建模能力的新一代生成模型(比如 Sora 2、Veo 3),已经在实践中展现出在视觉空间里执行显式推理的潜力——包括绘制中间演化步骤、标注关键语义区域、生成符合物理约束的运动轨迹等。研究团队强调:生成过程本身,或许就是更高阶、更本质的推理表达形式。
论文全文:https://www.php.cn/link/498bf3790c922596b795a8dfa3255b56
