梦瑶 发自 凹非寺量子位 | 公众号 QbitAI
开发者苦等已久的Qwen3.8-27B,终于正式开源了!
作为一款总参数量达270亿的大模型,它在最新Benchmark中的多项软件工程与Agent评测里表现相当亮眼,甚至让不少人直呼Claude要感受到压力了——
在Agent编程评测SWE-bench Pro上,Qwen3.8-27B以8.3分的优势超过Claude Opus 4.6 Max。
到了更考验真实软件工程能力的QwenSWEBench,领先幅度甚至进一步扩大到15.2分:

虽然模型尺寸不算大,但参数配置和整体性能表现一点也不弱——
原生多模态、262K原生上下文、最高100万Token扩展,再加上重点强化的Coding、专业工作和长程Agent能力,几乎一个都没缺席。
这样的开源模型,自然会让很多开发者第一时间想上手体验。
这不,已经有一大波网友开始密集实测了。
下面这位网友分别用3.8-27B和3.6-27B做了一个像素风宝塔效果,对比来看,3.8-27B在色彩细节和主体结构上明显更上一层楼~

还有网友用Qwen3.8-27B生成了一个俄罗斯方块——
甚至连按下空格键掉落时的屏幕抖动、消除行时出现的奖励倍增器效果,也都是模型自己补充进去的:

甚至还有网友感叹:这是不是意味着,以后差不多可以在本地运行“Opus级”模型了!?

Qwen这次的新模型,确实很有看点。。。

270亿参数,代码和Agent多项榜单超过Opus 4.6 Max
说实话,Qwen3.8这一代最近的上新速度确实相当快。。。
而这只27B版本,开发者们其实已经期待很久了。
在正式开源之前,社区里的“催更”几乎没有停过,也有不少人直接把它列为这一轮Qwen3.8中最值得等待的开源模型版本。
大家之所以这么关注,一个非常现实的原因就是——这次,普通用户自己的电脑真的有机会跑得动了。(doge)
毕竟——它的总参数量只有“270亿”。
换句话说,经过量化之后,24GB显存的RTX 3090、4090这类显卡,都有机会把模型完整装进单卡里~

模型尺寸降下来了,但上下文长度并没有缩水,依然原生支持262K Token上下文,而且还能继续扩展到100万Token。
具体到实际应用场景,这一代27B重点强化的方向也非常明确:
编程、专业工作、研究以及长程Agent任务,基本覆盖了当下开发者最常用大模型处理复杂工作的核心场景。
不过!这里我特别想单独拎出来强调一个能力——
“原生多模态”。
这一点值得重点关注,Qwen3.8-27B本身就具备视觉理解与解析能力。
也就是说,它不仅能读文本、写代码,还能直接看图片、读PDF文档、理解图表,甚至处理视频内容!!!

模型体积够小,适合本地部署;上下文足够长,能够处理大型工程;多模态和Agent能力也都完整保留。
至于这些能力到底达到了什么水平,最新榜单已经给出了一轮相当直观的答案。
我们先看最适合实际落地使用的两项能力——代码生成与Agent。
在编程评测SWE-bench Pro中,Qwen3.8-27B比Claude Opus 4.6 Max高出8.3分;到了软件工程评测QwenSWEBench,领先幅度进一步扩大到15.2分。
在Agent评测方面,面向计算机、金融、法律、医疗等专业长任务的CoWorkBench中,Qwen3.8-27B达到70.7分,也超过了Opus 4.6 Max的68.2分——

再来看多模态能力,模型的提升甚至更加集中、更加明显。
在电脑操作评测OSWorld-Verified中,Qwen3.8-27B拿到84.3分,而Opus 4.6 Max是72.7。
在手机操作评测AndroidWorld里,Qwen3.8-27B拿到了81.9分,而Opus 4.6 Max只有62.0;再看浏览器操作评测WebArena-Verified,成绩也从上一代的48.8提升到了64.8——

在通用多模态智能方面,也有几项关键维度值得关注。
在视觉数学问题解决能力上,开启CI后,Qwen3.8-27B拿到94.6分,是图中可见模型里的最高成绩。这类任务不只是识别图片里的文字,还需要同时理解图形、公式和空间关系。
在通用视觉推理方面,Qwen3.8-27B开启CI后做到85.6分,相比不开CI时的65.7提升非常明显。这类评测更偏向考察模型面对普通视觉场景时,能否从“看见内容”进一步走到“理解关系、完成判断”。
这些成绩也说明,这一代27B模型在看图、读文档和视觉推理等任务上的场景覆盖更广,整体性能也更强~

好模型自然值得一试,所以各路网友和开发者已经开始集体研究“这只小27B模型到底该怎么跑”了。(doge)
比如下面这位网友用Qwen3.8-27B做了一个贪吃蛇游戏后,直言感觉像是拥有了一个Opus级别的Agent——

还有网友直接把Qwen3.8-27B-FP8部署到一张NVIDIA GH200上进行实测,同时运行10个真实请求,每个请求最高输出16K Token、上下文拉到262K。
结果显示,首批流式Token基本都能在10ms内返回,10个请求也全部顺利完成,在高并发和长上下文场景下的运行稳定性确实很扎实:

还有网友表示,这个模型的多模态理解能力同样非常出色。
一次性丢给它一部1935年的11分钟电影,让模型识别其中96个带时间戳的事件,并逐字引用画面中的文字。
最终它在157秒内完成,时间点对应到具体画面时,整部影片的误差大约只有2秒,而且还是在单张GPU上跑完:

只能说,还是那个Qwen,依旧没有让人失望。。。
从Thinking推理档位到上下文理解,27B还有这些功能
除了前面这些榜单表现之外,Qwen3.8-27B这次还有一个非常实用的新变化。
那就是模型到底要“思考多久”,现在用户可以自己手动调节了,因为27B内置了一个“推理档位”——
模型默认开启Thinking模式,同时支持通过reasoning_effort调节推理深度,一共分为xhigh、medium和low三档。
复杂代码生成、长程Agent这类任务可以把档位调高;而简单问答、内容摘要、轻量任务则可以降低档位,优先换取速度和成本优势。
此外,Thinking本身也可以直接关闭,让模型跳过推理过程直接给出答案,定制化程度确实更高了。

此外,在长任务处理这件事上,还有一个很实用的功能——Qwen3.8-27B默认开启了preserve_thinking。
简单来说,就是Agent前几轮“怎么想的”,可以继续保留在后续上下文里。
比如Coding Agent连续修改十几个文件,推进到后面时还能沿着前面的决策继续执行,减少每轮重复梳理思路的成本,同时也能更好地利用KV Cache。
而要让这样一只体积不大的模型稳定扛住长任务,底层架构同样下了不少功夫。
说得更具体一些,Qwen3.8-27B总共由64层组成,其中48层使用Gated DeltaNet线性注意力,另外16层保留完整Attention,整体上基本遵循“三层线性注意力+一层完整Attention”这样的循环节奏。
线性注意力负责降低长序列场景下的计算与缓存压力,而完整Attention则每隔几层进行一次更充分的信息交互。
这套设计带来的最大优势就是——Qwen3.8-27B原生上下文可达262K Token,并且还能继续扩展到100万Token!!!

最后再说一下大家同样非常关心的问题——这个模型到底该怎么跑起来。
其实,答案非常简单。
目前官方已经为模型接入了Transformers、vLLM、SGLang和TokenSpeed。
如果是生产环境,或者你需要更高吞吐量的推理部署,Qwen更推荐使用SGLang、vLLM这类专业Serving引擎。
当然,对于本地部署玩家来说,操作还可以更省事一些。
Hugging Face也已经提供了量化版本入口,大家可以直接通过熟悉的工具链来完成部署。
换句话说,只要手里有一张高端消费级显卡,或者一台大内存Mac,基本就已经可以开始上手折腾这只Qwen3.8-27B了。(doge)
最新开源链接放在下面,感兴趣的朋友可以直接下载体验、动手实测~
[1]https://mp.weixin.qq.com/s/Ttv5cMD5p6DkUQWyoOsqCA
[2]https://huggingface.co/Qwen/Qwen3.8-27B
[3]https://www.modelscope.cn/collections/Qwen/Qwen38
