游乐游手机版
首页/AI热点日报/热点详情

消费级显卡运行Opus级Agent,Qwen3.8-27B多榜反超Claude

类型:热点整理2026-08-17
梦瑶 发自 凹非寺量子位 | 公众号 QbitAI开发者苦等已久的Qwen3 8-27B,终于正式开源了!作为一款总参数量达270亿的大模型,它在最新Benchmark中的多项软件工程与Agent评测里表现相当亮眼,甚至让不少人直呼Claude要感受到压力了——在Agent编程评测SWE-bench

梦瑶 发自 凹非寺量子位 | 公众号 QbitAI

开发者苦等已久的Qwen3.8-27B,终于正式开源了!

作为一款总参数量达270亿的大模型,它在最新Benchmark中的多项软件工程与Agent评测里表现相当亮眼,甚至让不少人直呼Claude要感受到压力了——

在Agent编程评测SWE-bench Pro上,Qwen3.8-27B以8.3分的优势超过Claude Opus 4.6 Max。

到了更考验真实软件工程能力的QwenSWEBench,领先幅度甚至进一步扩大到15.2分:



虽然模型尺寸不算大,但参数配置和整体性能表现一点也不弱——

原生多模态、262K原生上下文、最高100万Token扩展,再加上重点强化的Coding、专业工作和长程Agent能力,几乎一个都没缺席。

这样的开源模型,自然会让很多开发者第一时间想上手体验。

这不,已经有一大波网友开始密集实测了。

下面这位网友分别用3.8-27B和3.6-27B做了一个像素风宝塔效果,对比来看,3.8-27B在色彩细节和主体结构上明显更上一层楼~



还有网友用Qwen3.8-27B生成了一个俄罗斯方块——

甚至连按下空格键掉落时的屏幕抖动、消除行时出现的奖励倍增器效果,也都是模型自己补充进去的:



甚至还有网友感叹:这是不是意味着,以后差不多可以在本地运行“Opus级”模型了!?



Qwen这次的新模型,确实很有看点。。。



270亿参数,代码和Agent多项榜单超过Opus 4.6 Max

说实话,Qwen3.8这一代最近的上新速度确实相当快。。。

而这只27B版本,开发者们其实已经期待很久了。

在正式开源之前,社区里的“催更”几乎没有停过,也有不少人直接把它列为这一轮Qwen3.8中最值得等待的开源模型版本。

大家之所以这么关注,一个非常现实的原因就是——这次,普通用户自己的电脑真的有机会跑得动了。(doge)

毕竟——它的总参数量只有“270亿”。

换句话说,经过量化之后,24GB显存的RTX 3090、4090这类显卡,都有机会把模型完整装进单卡里~



模型尺寸降下来了,但上下文长度并没有缩水,依然原生支持262K Token上下文,而且还能继续扩展到100万Token。

具体到实际应用场景,这一代27B重点强化的方向也非常明确:

编程、专业工作、研究以及长程Agent任务,基本覆盖了当下开发者最常用大模型处理复杂工作的核心场景。

不过!这里我特别想单独拎出来强调一个能力——

“原生多模态”。

这一点值得重点关注,Qwen3.8-27B本身就具备视觉理解与解析能力。

也就是说,它不仅能读文本、写代码,还能直接看图片、读PDF文档、理解图表,甚至处理视频内容!!!



模型体积够小,适合本地部署;上下文足够长,能够处理大型工程;多模态和Agent能力也都完整保留。

至于这些能力到底达到了什么水平,最新榜单已经给出了一轮相当直观的答案。

我们先看最适合实际落地使用的两项能力——代码生成与Agent。

在编程评测SWE-bench Pro中,Qwen3.8-27B比Claude Opus 4.6 Max高出8.3分;到了软件工程评测QwenSWEBench,领先幅度进一步扩大到15.2分。

在Agent评测方面,面向计算机、金融、法律、医疗等专业长任务的CoWorkBench中,Qwen3.8-27B达到70.7分,也超过了Opus 4.6 Max的68.2分——



再来看多模态能力,模型的提升甚至更加集中、更加明显。

在电脑操作评测OSWorld-Verified中,Qwen3.8-27B拿到84.3分,而Opus 4.6 Max是72.7。

在手机操作评测AndroidWorld里,Qwen3.8-27B拿到了81.9分,而Opus 4.6 Max只有62.0;再看浏览器操作评测WebArena-Verified,成绩也从上一代的48.8提升到了64.8——



在通用多模态智能方面,也有几项关键维度值得关注。

在视觉数学问题解决能力上,开启CI后,Qwen3.8-27B拿到94.6分,是图中可见模型里的最高成绩。这类任务不只是识别图片里的文字,还需要同时理解图形、公式和空间关系。

在通用视觉推理方面,Qwen3.8-27B开启CI后做到85.6分,相比不开CI时的65.7提升非常明显。这类评测更偏向考察模型面对普通视觉场景时,能否从“看见内容”进一步走到“理解关系、完成判断”。

这些成绩也说明,这一代27B模型在看图、读文档和视觉推理等任务上的场景覆盖更广,整体性能也更强~



好模型自然值得一试,所以各路网友和开发者已经开始集体研究“这只小27B模型到底该怎么跑”了。(doge)

比如下面这位网友用Qwen3.8-27B做了一个贪吃蛇游戏后,直言感觉像是拥有了一个Opus级别的Agent——



还有网友直接把Qwen3.8-27B-FP8部署到一张NVIDIA GH200上进行实测,同时运行10个真实请求,每个请求最高输出16K Token、上下文拉到262K。

结果显示,首批流式Token基本都能在10ms内返回,10个请求也全部顺利完成,在高并发和长上下文场景下的运行稳定性确实很扎实:



还有网友表示,这个模型的多模态理解能力同样非常出色。

一次性丢给它一部1935年的11分钟电影,让模型识别其中96个带时间戳的事件,并逐字引用画面中的文字。

最终它在157秒内完成,时间点对应到具体画面时,整部影片的误差大约只有2秒,而且还是在单张GPU上跑完:



只能说,还是那个Qwen,依旧没有让人失望。。。

从Thinking推理档位到上下文理解,27B还有这些功能

除了前面这些榜单表现之外,Qwen3.8-27B这次还有一个非常实用的新变化。

那就是模型到底要“思考多久”,现在用户可以自己手动调节了,因为27B内置了一个“推理档位”——

模型默认开启Thinking模式,同时支持通过reasoning_effort调节推理深度,一共分为xhigh、medium和low三档。

复杂代码生成、长程Agent这类任务可以把档位调高;而简单问答、内容摘要、轻量任务则可以降低档位,优先换取速度和成本优势。

此外,Thinking本身也可以直接关闭,让模型跳过推理过程直接给出答案,定制化程度确实更高了。



此外,在长任务处理这件事上,还有一个很实用的功能——Qwen3.8-27B默认开启了preserve_thinking。

简单来说,就是Agent前几轮“怎么想的”,可以继续保留在后续上下文里。

比如Coding Agent连续修改十几个文件,推进到后面时还能沿着前面的决策继续执行,减少每轮重复梳理思路的成本,同时也能更好地利用KV Cache。

而要让这样一只体积不大的模型稳定扛住长任务,底层架构同样下了不少功夫。

说得更具体一些,Qwen3.8-27B总共由64层组成,其中48层使用Gated DeltaNet线性注意力,另外16层保留完整Attention,整体上基本遵循“三层线性注意力+一层完整Attention”这样的循环节奏。

线性注意力负责降低长序列场景下的计算与缓存压力,而完整Attention则每隔几层进行一次更充分的信息交互。

这套设计带来的最大优势就是——Qwen3.8-27B原生上下文可达262K Token,并且还能继续扩展到100万Token!!!



最后再说一下大家同样非常关心的问题——这个模型到底该怎么跑起来。

其实,答案非常简单。

目前官方已经为模型接入了Transformers、vLLM、SGLang和TokenSpeed。

如果是生产环境,或者你需要更高吞吐量的推理部署,Qwen更推荐使用SGLang、vLLM这类专业Serving引擎。

当然,对于本地部署玩家来说,操作还可以更省事一些。

Hugging Face也已经提供了量化版本入口,大家可以直接通过熟悉的工具链来完成部署。

换句话说,只要手里有一张高端消费级显卡,或者一台大内存Mac,基本就已经可以开始上手折腾这只Qwen3.8-27B了。(doge)

最新开源链接放在下面,感兴趣的朋友可以直接下载体验、动手实测~

[1]https://mp.weixin.qq.com/s/Ttv5cMD5p6DkUQWyoOsqCA

[2]https://huggingface.co/Qwen/Qwen3.8-27B
[3]https://www.modelscope.cn/collections/Qwen/Qwen38

来源:https://www.163.com/dy/article/L4CKC3580511DSSR.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。