游乐游手机版
首页/AI热点日报/热点详情

Qwen3-VL再开源30B-A3B模型实测

类型:热点整理2026-07-25
千问再放大招开源新模型:Qwen3-VL-30B-A3B,双卡4090即可运行,这次主打性价比 国庆假期尚未结束,千问便迅速推出了全新模型。此次开源的是Qwen3-VL-30B-A3B,一个总参数量达30B的MoE架构模型,但激活参数仅需3B,同时提供了FP8量化版本。这意味着什么?简单来说,仅需两

千问再放大招开源新模型:Qwen3-VL-30B-A3B,双卡4090即可运行,这次主打性价比

国庆假期尚未结束,千问便迅速推出了全新模型。此次开源的是Qwen3-VL-30B-A3B,一个总参数量达30B的MoE架构模型,但激活参数仅需3B,同时提供了FP8量化版本。这意味着什么?简单来说,仅需两张4090显卡即可流畅运行,其在端侧部署的潜力相当可观。

官方依然提供了两个版本:Instruct 和 Thinking。可以说,千问在“开源”这条路上已经将竞争推向了新的高度。

先为大家呈现一个快速总结的结论:

  • 整体模型能力不及Qwen3-VL-235B-A22B——这在意料之中,毕竟参数量和激活参数量的差距摆在那里;
  • 与Qwen3-VL-30B-A3B相比,Thinking版本在图像理解和计算任务上表现更为出色;
  • 表格识别能力略显薄弱,表现差强人意;
  • 在图片排序任务中,Thinking版表现优异,而Instruct版则表现不佳;
  • 数学解题能力令人眼前一亮,某些场景下甚至超越了Qwen3-30B-A3B;
  • 网页复刻效果依然不够理想;
  • 色盲测试图翻转后也能准确识别,这一点值得肯定。

下面直接进入各个维度的实际测试。

OCR识别能力

考察多模态模型对文本内容的提取能力,本次特意选择了手写体图片以增加难度。

指令:请识别图中的文本内容,言简意赅。

Qwen3-VL-30B-A3B:模型回答正确,识别准确

内容理解能力

测试模型能否真正理解图片中的语义信息。

指令:我今天喝了这个果汁会怎么样

Qwen3-VL-30B-A3B:模型回答正确,理解到位

表格识别能力

该任务要求将表格图片还原为HTML格式,既考验提取能力,也检验指令跟随效果。

Qwen3-VL-30B-A3B:模型回答错误,识别有误

网页复刻能力

检验模型在网页还原、审美判断以及代码开发方面的综合实力。

指令:请帮我1:1还原这个网页内容,用HTML呈现。

Qwen3-VL-30B-A3B:复刻效果欠佳,部分区域视觉效果不够自然。

报告分析能力

评估模型对文档内容的理解深度以及知识储备水平。

指令:请帮我解读一下报告内容。

Qwen3-VL-30B-A3B:模型解读正确,分析准确

理解与计算能力

同时测试模型的内容理解与数学计算能力。

指令:找到2024年GDP值最大的省份,并且计算占全国GDP的百分之多少?

已知2024年总和=1340312.8

Qwen3-VL-30B-A3B-Instruct:正确识别出广东,但最终计算结果出错

Qwen3-VL-30B-A3B-Thinking:模型回答完全正确,计算准确

目标识别能力

测试模型对具体物体的识别与计数能力。

指令:告诉我桌子上菇娘儿的个数。

Qwen3-VL-30B-A3B:模型回答正确,计数准确

精准定位能力

考察模型的精准定位能力。此前纯文本无法定位的内容,GC模型可以找到。

指令:找出图片中奔跑的人,以JSON格式返回边界框坐标。

Qwen3-VL-30B-A3B:

不过小恐龙仍然无法被定位到。

数学解题能力

采用2025年高考试题来检验模型的数学功底。

指令:解题

Qwen3-VL-30B-A3B:模型回答正确,最后一问也解答无误

图片排序能力

检验模型能否理解并理清多张图片间的逻辑关系以及事件发展顺序。

指令:根据图中显示的多个场景,将最有可能发生的事件按顺序排列。

正确答案为CADB:走到商店,买雪糕,滑倒,打到脸上

Qwen3-VL-30B-A3B-Instruct:模型回答错误,排序有误

Qwen3-VL-30B-A3B-Thinking:模型回答正确,排序准确

接着进行第二轮测试:正确答案为CDAB:有蘑菇,采摘并吃掉,有点晕,产生了幻觉蘑菇会走了

Qwen3-VL-30B-A3B:模型回答错误,理解能力不如235B版本。

空间逻辑能力

测试模型在理解图片基础上进行深度逻辑分析的能力。

指令:请回答。

正确答案为A。

Qwen3-VL-30B-A3B:模型回答错误。此外,在回答变长之后,中英文混杂的问题依然存在。

空间变换能力

考察模型对图像空间转换关系的理解能力。

指令:请回答。

Qwen3-VL-30B-A3B-Instruct:模型回答错误,识别有误

Qwen3-VL-30B-A3B-Thinking:模型回答正确,能准确识别主视图

色盲测试能力

测试模型对颜色的辨识能力。

指令:图片里有数字吗?如果有的话是什么?

正常者能读出6,红绿色盲者及红绿色弱者读成 5,而全色弱者则全然读不出上述的两个字。

Qwen3-VL-30B-A3B:模型回答正确,识别准确

将图片翻转后,模型同样能够正确识别。

综合来看,千问在开源领域依然保持着领先地位。

30B-A3B这个模型,虽然在部分能力上与自家更大规模的模型存在差距——但它的优势在于体积小巧。30B的MoE架构,激活量仅需3B,这意味着在端侧部署将非常便捷。

更关键的是,那些效果不太理想的方面,用户可以通过微调来优化解决。不像235B版本那样,只能远观而难以触及。这个十一假期,虽然竞争激烈,但能探索和优化的空间也变得更大了。

来源:https://www.53ai.com/news/OpenSourceLLM/2025100331864.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。