首页 游戏 软件 资讯 排行榜 专题
首页
AI
华为昇腾全栈开源DeepSeek-V3.2推理方案,赋能开发者创新

华为昇腾全栈开源DeepSeek-V3.2推理方案,赋能开发者创新

热心网友
44
转载
2025-09-30
来源:https://www.ithome.com/0/886/722.htm

9月29日消息,DeepSeek-V3.2-Exp模型于今日晚间正式发布并开源,创新性地采用了稀疏Attention架构。华为随即宣布昇腾AI已基于vLLM/SGLang等主流推理框架迅速完成适配部署,实现对该模型0day级别的全面支持,并向开发者开源了所有相关推理代码和算子实现。

据介绍,昇腾AI在DeepSeek-V3.2-Exp发布的第一时间就实现了该模型BF16格式的高效部署,并在CANN计算平台上完成了针对性优化。部署方案延续了DeepSeek的大EP并行策略,同时针对稀疏DSA架构特性,创新性地实现了CP并行策略,在128K超长序列场景下仍能保持TTFT低于2秒、TPOT低于30毫秒的优异推理性能。

NPU DeepSeek-V3.2-Exp推理优化实践:

https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek-v3.2-exp/deepseek_v3.2_exp_inference_guide.md

针对模型中全新引入的Lightning Indexer(LI)和Sparse Flash Attention(SFA)两大核心算子,昇腾团队创新性地优化了算子Tiling设计、Cube与Vector核间流水线调度等关键技术环节,现已开源相关模型和融合Kernel代码。

NPU DeepSeek-V3.2-Exp Ascend C融合算子优化:

https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek-v3.2-exp/deepseek_v3.2_exp_ascendc_operator_guide.md

为降低开发者使用门槛,CANN首次推出PyPTO大融合算子编程框架,采用PTO(Parallel Tensor/Tile Operation)创新编程范式,以Tensor为基本数据单元构建计算图。目前该框架已成功应用于DeepSeek-V3.2-Exp模型中两个核心算子的开发,仅需数百行代码即可完成动态Shape算子编程。

基于PyPTO的Lightning Indexer和DeepSeek Indexer Attention算子开发实践:

https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek-v3.2-exp/deepseek_v3.2_exp_pypto_operator_guide.md

除提供完整模型参考实践外,昇腾AI还全面支持vLLM和SGLang等主流推理框架,开发者可直接获取社区代码体验模型性能。未来将持续优化大模型在异构计算架构下的推理效率,重点提升算子融合、稀疏访存等核心能力。

大模型推理框架vLLM及昇腾实现:

https://github.com/vllm-project/vllm-ascend/tree/v0.9.1-dev/examples/deepseek.md

大模型推理框架SGLang及昇腾实现:

https://github.com/sgl-project/sglang/issues/11060

此外,昇腾与Tile-AI社区深度合作,基于其TileLang领域专用语言完成了Sparse Flash Attention等关键算子的NPU适配。后续将进一步完善NPU算子生态,持续提升计算性能。

NPU DeepSeek-V3.2-Exp TileLang算子开发实践:

https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek-v3.2-exp/deepseek_v3.2_exp_tilelang_operator_guide.md

TileLang-Ascend开源社区:

https://github.com/tile-ai/tilelang-ascend

免责声明: 游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关攻略

华为昇腾全栈开源DeepSeek-V3.2推理方案,赋能开发者创新
AI
华为昇腾全栈开源DeepSeek-V3.2推理方案,赋能开发者创新

9 月 29 日消息,今晚,DeepSeek-V3 2-Exp 发布并开源,引入稀疏 Attention 架构。华为宣布昇腾已快速基于 vLLM SGLang 等推理框架完成适配部署,实现 Dee

热心网友
09.30
商汤大装置与华为昇腾 384 超节点全面适配,多项创新提升训练效率
科技
商汤大装置与华为昇腾 384 超节点全面适配,多项创新提升训练效率

9 月 6 日消息,据商汤科技最新消息,近日,商汤大装置 SenseCore 与昇腾 384 超节点率先完成全面适配,在功能、性能验证上达到预期目标。据最新介绍,超节点(SuperPod)是一种通

热心网友
09.07

最新APP

全民僵尸大战九游
全民僵尸大战九游
棋牌策略 10-04
未定事件簿台服
未定事件簿台服
角色扮演 10-04
未定事件簿手游
未定事件簿手游
角色扮演 10-04
迷失蔚蓝华为
迷失蔚蓝华为
角色扮演 10-04
超级登山坦克
超级登山坦克
飞行射击 10-04

热门推荐

09-25年180款显卡横评:RTX 5090较HD5870提升2477%
电脑教程
09-25年180款显卡横评:RTX 5090较HD5870提升2477%

10月4日消息,德国知名硬件 PC Games Hardware(PCGH)迎来了25周年纪念,为了庆祝这一时刻,PCGH选择了一种独特的方式——对180款显卡进行大规模评测,涵盖了从2009年到2

热心网友
10.04
2025中国电影票房425亿创新高,《哪吒》领跑全球动画
科技
2025中国电影票房425亿创新高,《哪吒》领跑全球动画

截至2025年10月2日14时16分,全国电影票房(含预售)突破425 022亿元,正式超越2024年全年票房总额。根据专业数据平台显示,今年国内上映影片已超过300部,题材覆盖历史、喜剧、动画、奇

热心网友
10.04
咒术回战262话:乙骨攸太重伤,里香全形态爆发
科技
咒术回战262话:乙骨攸太重伤,里香全形态爆发

《咒术回战》第262话图透已流出,本期只有7页内容,整体节奏紧凑但略显混乱。乙骨忧太操控五条悟与宿傩在领域层面上展开激烈对抗。在战斗中,宿傩突然施展了「领域展延」,一举突破了乙骨设置的下限防御,这让

热心网友
10.04
《羊蹄山之魂》女主笃开启复仇救赎之路
科技
《羊蹄山之魂》女主笃开启复仇救赎之路

由Sucker Punch开发并由索尼发行的动作冒险游戏羊蹄山之魂已于今日正式上线。游戏中,玩家将扮演女主角“笃”,踏上一段充满复仇与救赎的旅程。十六年前,笃的家人惨遭“羊蹄六人组”杀害,她本人虽幸

热心网友
10.04
2024年AI产业规模将超9000亿,5300家企业完善产业生态
AI
2024年AI产业规模将超9000亿,5300家企业完善产业生态

根据中国信息通信研究院最新发布的测算数据,2024年我国人工智能产业迎来显著增长,产业规模突破9000亿元大关,较上一年度实现24%的同比增速。这一数据反映出我国人工智能领域持续保持的高质量发展态势

热心网友
10.04