2026年8月14日晚,阿里巴巴通义千问大模型团队正式开源Qwen3.8-27B模型。该大模型发布后,昇腾平台同步完成首日适配,依托vLLM-Ascend开源推理引擎,已在Atlas 800 A3与Atlas 850E超节点上实现高效推理部署,进一步提升了Qwen3.8-27B在国产算力平台上的落地效率。

Qwen3.8-27B是一款原生多模态稠密架构大模型,参数规模达到270亿。该模型原生支持262K tokens上下文长度,并可借助YaRN技术扩展至最高1M tokens,具备更强的长上下文理解与超长文本处理能力,适用于复杂内容生成、多轮交互和长文档分析等场景。
从模型架构来看,Qwen3.8-27B采用混合线性注意力方案:全模型共64层,其中48层引入Gated DeltaNet线性注意力,另外16层保留标准全注意力机制。通过这一设计,传统长序列任务中O(n²)计算复杂度带来的性能瓶颈得到有效缓解,在尽量保持建模精度的同时,显著提升了长文本推理效率与整体处理速度。
从性能测试结果来看,Qwen3.8-27B在编程、代码生成以及办公自动化等任务上的提升十分明显,已全面超过上一代Qwen3.6-27B,整体表现也优于Qwen3.7-Plus。在Agentic terminal coding基准测试中,该模型获得73.0分,较前代提升9.6分;在SWE-bench Pro测试中,取得61.7分,提升8.2分。同时,模型新增reasoning_effort机制,能够根据任务复杂度自动调节推理深度,在保证生成效果和准确性的基础上,更合理地控制计算资源消耗。
针对Qwen3.8-27B的模型特性,昇腾平台进行了多项深度优化:在Prefill阶段引入GDN融合算子,并以Chunk化方式处理超长序列,大幅降低中间数据搬运和算子调度开销;支持W8A8量化部署,将权重与激活值从BF16精度压缩至8位整型,充分释放昇腾NPU在INT8与MXFP8精度下的硬件算力;结合模型原生MTP投机推理能力,由MTP模块预测后续Token并由主模型并行校验,从而减少主模型调用频次;在Decode阶段支持将计算逻辑编译为设备端执行图(ACLGraph),有效降低重复调度带来的性能损耗,进一步提升推理吞吐与部署效率。
目前,Qwen3.8-27B已在Hugging Face及魔搭社区(ModelScope)同步开放下载。与此同时,昇腾平台也提供了完整部署指南,用户可通过vLLM-Ascend开源推理引擎快速完成本地化推理部署,加快多模态大模型在企业与开发场景中的应用落地。
