编辑 | 王凤枝
又一款国产开源模型,这两天在海外开发者社区迅速走红。
8月14日,阿里Qwen团队正式开放Qwen3.8-27B权重。这是一款拥有27B参数的稠密模型,支持视觉理解能力,并采用Apache 2.0许可协议。在Artificial Analysis当前榜单中,Qwen3.8-27B与OpenAI的GPT-5.6 Luna获得了相同评分。

它的下载热度也很快攀升。据Hugging Face相关模型页面统计,截至8月17日前后,最新版模型及社区量化版本的累计下载请求已经突破300万次。
首批实测结果也很快出炉。开发者西蒙·威利森(Simon Willison)的测试表明,Qwen3.8-27B不仅能在图片中定位目标物体,还能通过编程智能体编写并调试一个小型工具。
不过,这款模型最出人意料的地方,反而是“想太多”。

威利森让它生成一张鹈鹕SVG图像,模型从思考到输出总共花了21分钟;而关闭推理后,完成类似任务仅用了137秒(约两分钟)。即便面对“画一个圆”这样非常简单的需求,它也会主动加入动画与交互效果,做出一个更复杂的作品,却没有直接交付用户真正需要的那个圆。
Qwen3.8-27B已经具备本地看图、写代码、驱动智能体的能力。接下来,它能否成为开发者和普通用户的日常AI工具,关键要看速度、稳定性以及调试成本。
一、300万次下载,很多人拿到的是轻量版
300万次下载,并不意味着有300万人已经把Qwen3.8-27B安装到本地电脑中。Hugging Face统计的是相关文件下载请求,同一个用户可能会连续尝试多个版本。不过,一款开源大模型发布几天内就出现如此密集的下载,依然说明开发者社区有很强的尝试意愿。
Qwen3.8-27B的BF16原版体积约55GB,对大多数个人电脑来说依然偏大。模型发布后,官方和社区很快推出了适配不同硬件与推理工具的版本:GGUF常用于LM Studio和llama.cpp,MLX面向苹果芯片,FP8和NVFP4则分别适配不同的英伟达显卡。
这些版本进一步降低了本地部署门槛,用户可以根据自己的显卡、内存和推理软件,直接选择适合的现成版本。从各页面的下载数据来看,这些轻量化版本贡献了相当大一部分下载请求。
llama.cpp创始人格奥尔基·格尔加诺夫(Georgi Gerganov)也很快给出了现成运行命令,覆盖DGX Spark和RTX 5090等设备。用户可以直接调用量化版本,并开启多token预测加速,省去手动转换权重的麻烦。与此同时,其他开发者开始测试单卡、双卡以及苹果芯片设备,讨论重点也随之转向更实际的问题:能保留多长上下文、生成速度到底有多快、视觉能力是否足够稳定。
其中,约17GB的Q4版本成为不少人关注的焦点。它通过降低权重精度,把文件体积压缩到原版的三分之一左右,也让这款模型有机会运行在部分个人设备上。不过,体积缩小并非没有代价,量化版本在输出质量、视觉表现和运行稳定性上,都可能与BF16原版存在差异。
二、17GB,装下一个真正能干活的模型
威利森测试的是LM Studio提供的约17GB Q4_K_M量化版本。他分别在配备128GB内存的M5 Max MacBook Pro和英伟达DGX Spark上进行了运行测试。
在视觉测试中,他让模型识别一张照片中的两只鹈鹕,并以JSON格式返回它们的位置。模型给出的两个方框与照片中的鹈鹕位置基本吻合。随后,他又让Qwen编写一个网页工具:用户输入图片地址和坐标数据后,网页即可把方框与标签叠加显示在图片上。

在开启最高推理档位时,模型生成了一个功能完整、但明显存在过度设计倾向的界面,甚至还主动绘制了一幅鹈鹕示例图。关闭推理后,它输出的页面看起来依旧完整,但方框位置却出现了偏差。

威利森还将这一量化版本接入编程智能体Pi。他先让模型分析Datasette项目的身份验证机制,模型读取多个文件后给出了解释。随后,他要求模型把Pi保存的JSONL对话记录转换为Markdown,Qwen编写并测试了一段Python程序,威利森最终也确实使用这段程序发布了本次测试的对话记录。
速度是威利森提到的主要短板。根据他在LM Studio中的实测,生成速度大约为每秒15至30个token,明显慢于他平时常用的云端模型。不过改用llama.cpp并开启多token预测之后,DGX Spark上的对比测试速度提升了约72%。

三、显存够了,也不意味着省心
约17GB只是模型文件本身的大小。真正运行时,长文本上下文、图片处理以及推理软件本身还会持续占用额外内存。即便用户使用的是24GB显存的高端显卡,仍然需要考虑还能保留多少上下文、两张显卡如何分担模型负载,以及视觉功能在不同推理软件中是否稳定。三组海外实测,给出了并不完全相同的答案。
Reddit用户Round-Comparison-675使用一张RTX 4090显卡,将上下文长度开到16万,并让模型完全由GPU运行。按照他的测试结果,生成速度约为每秒47至57个token,已经能够满足编程和其他连续型任务需求。

用户Ecstatic-Wash-7667则使用两张RTX 3060 12GB显卡,在12.8万上下文、MTP2和Q4_K_XL量化设置下,测得每秒50.6个token,显存占用达到23.2/24.0GB。不过,他随后补充称,不同测试场景下的速度表现并不稳定:基准测试大约为每秒36个token,而在实际提示词中又能够接近每秒50个token。为了给日常运行预留更多余量,他最终把上下文降到了11.2万。

RTX3090用户jonaddb则花了近14个小时进行调试。他最终把上下文长度开到13.1万,生成速度超过每秒60个token;但视觉功能最初会直接崩溃,需要调整计算精度后,才能正常识别一张1080P截图。对他来说,模型能力本身并不是主要障碍,显卡架构与推理软件之间的适配问题反而耗费了更多时间。

这三组测试共同说明,Qwen3.8-27B的量化版本已经具备承担实际任务的能力,但距离真正意义上的开箱即用,仍然还有一段距离。
四、“想太多”并不是一句玩笑
Qwen3.8-27B提供最高、中等、较低以及关闭推理等多个档位,但默认选择的是最高档。面对复杂任务时,多思考一会儿确实可能减少中途走偏的情况;但遇到简单问题时,同样的设置却可能把原本几秒钟就能完成的任务,拖长到几分钟。
社区内部的看法并不一致。有用户认为,Qwen3.8-27B相比前代进步明显,但即使把推理档位调到中等,模型仍然可能思考很久,因此暂时不会把它当作日常主力模型。
也有人偏爱这种风格。社区实测显示,最高推理档虽然明显更耗时,却有机会换来更完整、更周全的输出。任务足够复杂时,“想得多”可能意味着少走几次弯路;但如果只是改写一句话、提取一段信息,或者生成一段简单代码,这样的“耐心”就会变成负担。
云端模型多想一会儿,用户最先感受到的是账单上涨;而本地部署虽然省去了按次调用API的云端费用,但模型多想一会儿,也意味着等待更久、耗电更多、显卡温度更高。Qwen3.8-27B已经允许用户手动调节推理强度,接下来的关键问题是,模型能否根据任务难度自行判断:什么时候需要认真推理,什么时候应该直接给出答案。
五、Meta、谷歌也在争夺本地模型市场
今年6月,谷歌推出了Gemma 412B,并把16GB显存或统一内存设定为本地运行门槛,目标是应用到办公、内容处理以及智能体工作流场景。同系列的31B版本则更聚焦于编程、视觉理解和更复杂的推理任务。至此,谷歌已经通过不同体量的模型,实现了从普通笔记本到高性能工作站等多类设备的覆盖。

8月10日,Meta发布了30B参数的MuseGlimmer,主打编程、工具调用和本地智能体任务。扎克伯格也在同一天再次强调开放模型的重要性,并表示Meta将恢复发布部分开放权重模型。

Qwen3.8-27B与Muse Glimmer在体量上相近,面向的也都是能够在个人设备上运行的智能体任务;谷歌则借助Gemma覆盖了更广泛的硬件区间。三家公司正在争夺的,是介于云端旗舰模型与普通小模型之间的本地AI使用空间。
Qwen这次最突出的特点,是社区响应速度极快。模型发布后,量化版本、运行配置和排障经验几乎同步出现。相比之下,Muse Glimmer和Gemma背后则分别站着Meta与谷歌完整的研发和产品生态,这场本地大模型竞争显然不会停留在一次发布上。300万次下载至少说明,很多开发者愿意先上手试一试。接下来更难的一步,是把这些仍需要反复调试的方案,真正变成稳定、默认、可持续的本地使用路径。
