游乐游手机版
首页/AI热点日报/热点详情

后摩智能漫界M50芯片适配阿里千问Qwen3.8-27B大模型完成

类型:热点整理2026-08-16
8月14日晚,阿里巴巴通义实验室正式开源 Qwen3 8-27B。作为千问团队的重要合作伙伴,后摩智能同步完成了 Qwen3 8-27B 在后摩漫界 M50 芯片上的深度适配,并首次将 27B 级大模型的端侧部署效率推进到 Day 0。开发者借助后摩大道工具链,即可在 M50 平台上完成从量化编译到

8月14日晚,阿里巴巴通义实验室正式开源 Qwen3.8-27B。作为千问团队的重要合作伙伴,后摩智能同步完成了 Qwen3.8-27B 在后摩漫界 M50 芯片上的深度适配,并首次将 27B 级大模型的端侧部署效率推进到 Day 0。

开发者借助后摩大道工具链,即可在 M50 平台上完成从量化编译到推理部署的全流程操作,实现 Qwen3.8-27B + 单 M50 或双 M50 在端侧设备上的本地运行与落地部署。

(DM50 上部署 Qwen3.8-27B+mtp 的实测性能)

Qwen3.8-27B 是一款原生多模态稠密(Dense)模型,支持 262K 原生上下文,并可通过 YaRN 技术扩展至 1M Tokens 上下文。相比 Qwen3.6-27B,新模型在编程、办公等应用场景中的性能显著提升,整体表现甚至超过了 Qwen3.7-Plus;与此同时,模型新增了 reasoning_effort 功能,可依据任务复杂度动态控制思考深度,从而进一步节省计算资源。Qwen3.8-27B 也延续了 Qwen3.8 系列模型的通用能力,能够端到端完成复杂任务,并直接输出经得起检验的可靠结果。

(千问官方发布 Qwen3.8-27B Text Performance)

Qwen 最强 27B 模型,10W 端侧落地

这些年来,端侧 AI 始终面临一个核心矛盾:一方面,大模型参数规模持续增长;另一方面,终端设备的物理限制却几乎没有明显变化。以 Qwen3.8-27B 为例,其 4-bit 量化版本体积约为 17GB;而在硬件层面,M50 单芯片功耗仅为 10~15W,双芯片总功耗也不到 30W。也就是说,一台甚至可由移动电源供电的端侧设备,如今已经能够在本地运行千问当前最强的开源 27B 模型。

更关键的是响应速度。模型权重在发布当天便完成适配,开发者无需再等待芯片厂商传统的适配周期,从而更快推进大模型端侧部署与应用开发。

Day 0 背后的技术底座:架构级兼容能力

为什么 Day 0 适配能够实现?核心原因在于后摩大道工具链的适配策略是以模型架构为单位,而不是以单个模型为单位进行支持。同一架构下的模型共享相同的 ONNX 导出图,因此量化与编译流程可以直接复用。

Qwen3.8-27B 与后摩智能此前已支持的 Qwen3.6 系列共享底层架构,这正是本次 Day 0 适配能够快速完成的技术基础。工具链内部已经完成了该架构的算子映射和推理引擎对接,因此在模型权重发布后,无需重新进行底层适配,可直接进入量化编译阶段。

在生态兼容层面,后摩大道工具链已内置 Qwen 系列的完整算子优化能力,支持 PyTorch、vLLM 等主流框架;编译产物还可通过 llama.cpp、vLLM、SGLang 等推理引擎部署为标准化 API 服务,并与 OpenClaw 等 Agent 框架无缝集成。搭载 M50 芯片的量产端侧设备也可同步支持 Qwen3.8-27B 本地推理。

工具链全流程:从权重到部署

后摩大道工具链覆盖从模型量化、编译到推理服务上线的完整链路。以下为 Qwen3.8-27B 在 M50 上的完整部署流程。

1. 资源下载

可从后摩开发者社区下载工具链资源包,并从 Hugging Face 或 ModelScope 获取 Qwen3.8-27B 模型权重文件。

2. 量化导出

后摩采用 GPTQ 后训练量化方案,核心流程为逐层替代:每次仅加载单层到 GPU,利用校准数据执行前向计算以收集激活值分布,再基于 Hessian 矩阵将 FP16 权重压缩为 4-bit,在尽可能降低量化误差的同时保证模型精度。

python ptq.py --config config.yaml --model

/Qwen3.8-27B/

在 HMONNX 导出阶段,系统会将量化后的权重加载到 ONNX 计算图中。导出完成后,还会自动执行余弦相似度校验,对比 PyTorch 原始输出与 HMONNX 输出结果,确保精度保持一致且无明显偏差。

3. 编译

编译阶段会将 HMONNX 图进一步转换为 M50 可执行的 HMM 文件:

执行时可直接使用这条命令:python build.py --model_dir output/xh2/hmquant --model_name qwen3.8-27b --ncore 2 --context_length 32768 --prefill_length 256 --stage build --j 16 --ndevice 1

参数说明:

--ncore 2:表示芯片运行时调用的计算核心数量

--context_length 32768:表示最大上下文窗口,编译阶段设置为 32K 以提升编译效率,M50 实际可支持更大的上下文窗口

--prefill_length 256:表示 prefill 阶段每次分块处理的 token 数量

--ndevice 1:表示单芯片编译,也可以指定 2 以支持双芯片部署

--stage build:表示仅执行编译,确认通过后还可追加 --stage test 进行余弦相似度验证

4. 推理测试

编译完成后,即可在 M50 设备上进行本地推理测试:

python demo.py --tokenizer_dir --prefill_path output/xh2/qwen3.8-27b_prefill.hmm --decode_path output/xh2/qwen3.8-27b_decode.hmm --embedding_path output/xh2/hmquant/quant_embedding.pt --ndevice 1 --topk 50 --topp 0.9 --repetition_penalty 1.05

5. 通过 llama.cpp 部署推理服务

工具链支持将编译产物转换为 GGUF 格式,再通过 llama-server 部署为生产级推理服务:

python ./scripts/convert_hm_to_gguf.py /

--use-temp-file./bin/llama-server -m ./scripts/qwen3.8-27b.gguf

部署完成后,可通过 OpenAI 兼容 API 接入 Agent 框架,从而实现从模型推理到实际业务落地的完整闭环。

来源:https://m.elecfans.com/article/8228925.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。