游乐游手机版
首页/AI热点日报/热点详情

阿里云Qwen3重大升级全面超越DeepSeek与Kimi

类型:热点整理2026-07-19
阿里云的Qwen系列又悄悄放了个大招。这次更新的版本叫Qwen3‑235B‑A22B‑Instruct‑2507‑FP8,名字看着有些拗口,但它的实际表现确实让人眼前一亮——不仅在多个权威榜单上完成了对DeepSeek和刚刚发布的Kimi K2的超越,甚至在某些任务中已经逼近GPT-4的水平。 从整

阿里云的Qwen系列又悄悄放了个大招。这次更新的版本叫Qwen3‑235B‑A22B‑Instruct‑2507‑FP8,名字看着有些拗口,但它的实际表现确实让人眼前一亮——不仅在多个权威榜单上完成了对DeepSeek和刚刚发布的Kimi K2的超越,甚至在某些任务中已经逼近GPT-4的水平。

从整体来看,这次升级主要围绕三个关键方向:更轻量的部署方案、更强的长上下文处理能力,以及推理能力的显著跃升。下面我们逐一聊聊。

1. 更轻量的部署方案

过去跑这类大模型,百G显存起步几乎是标配,普通机器很难部署。这次阿里把FP8精度量化方案引入到了Qwen3中,模型文件体积直接从437GB降到了220GB左右。成本砍半,体验不减——只要有一块30GB显存的显卡,就能跑起当前最强的开源模型之一。对于那些希望在本地或边缘设备上部署大模型的团队来说,这无疑是个好消息。

2. 上下文能力提升

长上下文处理能力一直是Kimi的强项,没想到这次Qwen3也补上了这块短板。目前支持的token数提升到了256K,完全能和Kimi K2、Claude 3相提并论。从实际体验来看,这种能力在代码补全、合同审查、长文摘要等任务中表现尤为突出。看得出来,阿里不只是简单的模仿,而是在扎实地把这部分功能做到位。

3. 推理能力暴涨

这是最让人兴奋的一块。Qwen3在AIME(美国高中数学邀请赛)基准测试中拿下了70.3分的高分,而GPT-4o是26.7分,DeepSeek-V3是46.6分,Claude 3 Opus是61.7分。坦白说,看到这个得分的第一反应,确实有点怀疑是不是水分多了点,毕竟这个领先幅度太夸张了。当然,如果你了解AIME的权威性,可能会对我的怀疑不以为然。

不仅仅是数学能力,Qwen3在编程和Agent任务上也表现惊艳。在LiveCodeBench v6编程测试中,它获得51.8分;在BFCL-v3测试中,以70.9的得分接近人类专业水平(97.3分)。

从多个公开榜单来看,在LMSYS Arena的对比测试中,Qwen3的指令微调版本得分已超过DeepSeek R1与Kimi K2 Base;在Hugging Face与OpenRouter上,其调用量和社区讨论热度也在快速上升。

很多人可能低估了阿里在大模型上的战略野心。实际上,Qwen系列不是单点突破,而是整个“通义千问”体系的一环。这次的指令微调版本,不再像早期开源模型那样“什么都能聊,什么都不准”,而是明确面向实际任务进行了优化。具体来说,多轮任务执行能力增强,工具调用接口更清晰,代码生成和调试能力也更贴近IDE场景——看得出来,阿里确实是奔着“真的可用、能部署、能赚钱”的方向来的。

还有一个明显的信号:这次Qwen的升级并不是孤立的技术动作,而是与阿里系产品矩阵深度捆绑。比如,钉钉已经内置了通义千问的能力,阿里云API也将Qwen3作为主力大模型提供调用,通义APP也在逐步构建自己的Copilot能力,布局类ChatGPT智能体系统。说白了,阿里不是在做一个模型,而是在构建一个“模型即平台”的生态系统。而生态系统的竞争,可能是接下来AI领域最大的看点——腾讯、字节、阿里都在加速朝这个方向跑。

阿里在AI技术上的进步,在几个大厂里应该算是最稳的一个了。每次模型发布都悄咪咪的,不过度宣传,主打一个稳扎稳打,反而给人留下一种干实事的印象。这次Qwen的进步尤为关键,希望阿里在AI上前进的每一步,都能继续带来不一样的东西。现在这种稳得住的态度,确实让人对国产大模型的未来多了几分信心。

来源:https://www.53ai.com/news/OpenSourceLLM/2025073059872.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。