千问再放大招开源新模型:Qwen3-VL-30B-A3B,双卡4090即可运行,这次主打性价比
国庆假期尚未结束,千问便迅速推出了全新模型。此次开源的是Qwen3-VL-30B-A3B,一个总参数量达30B的MoE架构模型,但激活参数仅需3B,同时提供了FP8量化版本。这意味着什么?简单来说,仅需两张4090显卡即可流畅运行,其在端侧部署的潜力相当可观。
官方依然提供了两个版本:Instruct 和 Thinking。可以说,千问在“开源”这条路上已经将竞争推向了新的高度。
先为大家呈现一个快速总结的结论:
- 整体模型能力不及Qwen3-VL-235B-A22B——这在意料之中,毕竟参数量和激活参数量的差距摆在那里;
- 与Qwen3-VL-30B-A3B相比,Thinking版本在图像理解和计算任务上表现更为出色;
- 表格识别能力略显薄弱,表现差强人意;
- 在图片排序任务中,Thinking版表现优异,而Instruct版则表现不佳;
- 数学解题能力令人眼前一亮,某些场景下甚至超越了Qwen3-30B-A3B;
- 网页复刻效果依然不够理想;
- 色盲测试图翻转后也能准确识别,这一点值得肯定。
下面直接进入各个维度的实际测试。
OCR识别能力
考察多模态模型对文本内容的提取能力,本次特意选择了手写体图片以增加难度。
指令:请识别图中的文本内容,言简意赅。
Qwen3-VL-30B-A3B:模型回答正确,识别准确
内容理解能力
测试模型能否真正理解图片中的语义信息。
指令:我今天喝了这个果汁会怎么样
Qwen3-VL-30B-A3B:模型回答正确,理解到位
表格识别能力
该任务要求将表格图片还原为HTML格式,既考验提取能力,也检验指令跟随效果。
Qwen3-VL-30B-A3B:模型回答错误,识别有误
网页复刻能力
检验模型在网页还原、审美判断以及代码开发方面的综合实力。
指令:请帮我1:1还原这个网页内容,用HTML呈现。
Qwen3-VL-30B-A3B:复刻效果欠佳,部分区域视觉效果不够自然。
报告分析能力
评估模型对文档内容的理解深度以及知识储备水平。
指令:请帮我解读一下报告内容。
Qwen3-VL-30B-A3B:模型解读正确,分析准确
理解与计算能力
同时测试模型的内容理解与数学计算能力。
指令:找到2024年GDP值最大的省份,并且计算占全国GDP的百分之多少?
已知2024年总和=1340312.8
Qwen3-VL-30B-A3B-Instruct:正确识别出广东,但最终计算结果出错

Qwen3-VL-30B-A3B-Thinking:模型回答完全正确,计算准确

目标识别能力
测试模型对具体物体的识别与计数能力。
指令:告诉我桌子上菇娘儿的个数。

Qwen3-VL-30B-A3B:模型回答正确,计数准确

精准定位能力
考察模型的精准定位能力。此前纯文本无法定位的内容,GC模型可以找到。
指令:找出图片中奔跑的人,以JSON格式返回边界框坐标。

Qwen3-VL-30B-A3B:

不过小恐龙仍然无法被定位到。

数学解题能力
采用2025年高考试题来检验模型的数学功底。
指令:解题
Qwen3-VL-30B-A3B:模型回答正确,最后一问也解答无误
图片排序能力
检验模型能否理解并理清多张图片间的逻辑关系以及事件发展顺序。
指令:根据图中显示的多个场景,将最有可能发生的事件按顺序排列。
正确答案为CADB:走到商店,买雪糕,滑倒,打到脸上
Qwen3-VL-30B-A3B-Instruct:模型回答错误,排序有误
Qwen3-VL-30B-A3B-Thinking:模型回答正确,排序准确
接着进行第二轮测试:正确答案为CDAB:有蘑菇,采摘并吃掉,有点晕,产生了幻觉蘑菇会走了
Qwen3-VL-30B-A3B:模型回答错误,理解能力不如235B版本。
空间逻辑能力
测试模型在理解图片基础上进行深度逻辑分析的能力。
指令:请回答。
正确答案为A。
Qwen3-VL-30B-A3B:模型回答错误。此外,在回答变长之后,中英文混杂的问题依然存在。
空间变换能力
考察模型对图像空间转换关系的理解能力。
指令:请回答。
Qwen3-VL-30B-A3B-Instruct:模型回答错误,识别有误
Qwen3-VL-30B-A3B-Thinking:模型回答正确,能准确识别主视图
色盲测试能力
测试模型对颜色的辨识能力。
指令:图片里有数字吗?如果有的话是什么?
正常者能读出6,红绿色盲者及红绿色弱者读成 5,而全色弱者则全然读不出上述的两个字。
Qwen3-VL-30B-A3B:模型回答正确,识别准确
将图片翻转后,模型同样能够正确识别。
综合来看,千问在开源领域依然保持着领先地位。
30B-A3B这个模型,虽然在部分能力上与自家更大规模的模型存在差距——但它的优势在于体积小巧。30B的MoE架构,激活量仅需3B,这意味着在端侧部署将非常便捷。
更关键的是,那些效果不太理想的方面,用户可以通过微调来优化解决。不像235B版本那样,只能远观而难以触及。这个十一假期,虽然竞争激烈,但能探索和优化的空间也变得更大了。
